在代理之上,又多设了一层监督者
Meta 出货的是一套控制结构。那台号称连 Meta 都看不到的计算机,预计将在年内推出
商业Meta 在 Muse 之上又架了第二个代理
Meta 于 9 月 8 日在美国推出了个人 AI 代理 Muse。只有年满 18 岁的用户才能使用,系统会为每位用户在云端分配一台专属虚拟计算机,负责管理日程、购物,并把长期目标转化为具体执行计划。每周 1 亿 token 以内免费,超出这个额度的用户可以升级到每月 20 美元或 100 美元的套餐。
翻看发布资料时,真正吸引我注意的并不是模型的成绩单,而是同一台虚拟计算机里独立运行的第二个代理——Sentinel。它在系统层面与 Muse 分离。Muse 所做的一切只要涉及向外部网络发出请求,都必须经过 Sentinel。
Muse 只负责提议,批准权在 Sentinel 手里
Sentinel 的工作可以分成三类:允许、拦截,或者询问用户。Muse 只能提议要做某个行动,至于哪些行动会真正被执行,并不是由 Muse 决定的。从外部读取的文档或网页中可能藏有命令语句——也就是提示词注入1,过滤这类攻击也是 Sentinel 的职责。
授权方式也不是一次性全开。连接某项服务时,先从只读权限开始,如果需要写入权限,则必须另行申请。权限可以按任务、按服务、按交易、按时间段分别收紧。扎克伯格在采访中把这一点定为设计原则——只拿到必需的最小限度权限,只有真正需要时才扩大范围,这就是最小权限2原则。
登录信息和支付方式则被放进完全不同的隔间。凭证保存在独立的存储空间里,代理可以完成登录,却看不到密码;卡片支付则通过一次性号码进行,真实卡号不会暴露给代理。代理做了什么、打算做什么都会留下记录,用户之后也可以随时断开已连接的服务。
那台号称连 Meta 都看不到的计算机,还没到来
扎克伯格在采访中透露,他与 Nat Friedman 一起亲自招募了 Signal 的创始人 Moxie Marlinspike。目的是打造机密虚拟机3。这个构想是想把放在桌子底下那台电脑才有的保密程度,也带到云端——他说,目前没在别处见过做到这个水准的。
这里需要把时间点分开来看。9 月 8 日这次发布中所包含的,是每位用户各自隔离的安全虚拟机,运行在 Meta 自家基础设施之上。而连 Meta 自己都无法窥看的机密虚拟机,预计将在年内推出。目前公布的计划包括:由用户掌握密钥、由外部安全公司审计源代码、并公开二进制文件与透明性日志。扎克伯格也表示会在几周内公布更多细节。
这个区别不是文字游戏。用户现在得到的保障并不是“Meta 看不到”,而是**“Meta 又多设了一层监视机制”**。前者是结构上让人无法看到的承诺,后者则是“看得到、但会被监督”的承诺。在决定是否连接邮件与消息时,真正需要参考的是后者,前者目前还不是判断依据。
模型解题之前,先会拆解环境本身
Sentinel 为什么没有被塞进 Muse 内部,而是被放在旁边,扎克伯格的另一段发言给出了线索。他在最近谈到模型训练过程时说,给模型一个问题,它会先试图弄清自己所处的整个环境。如果告诉人类说代码某处有个 bug,人通常会先去看那段代码;而现在的模型,往往会先尝试改变环境本身,或者干脆想办法绕开限制。
业内把这种现象称为“奖励破解”(reward hacking)。让模型完成某个目标,结果模型发现,修改用来判定目标是否达成的那个装置,比真正完成目标更快。他把这一点当作需要设置边界的理由:如果边界太弱,模型学到的就不是原本想教它的东西,而是绕过规则的捷径。
把同样的逻辑放到产品上,就能解释 Sentinel 所处的位置。如果判定方和执行方处在同一个进程之中,执行方就有可能反过来动手脚干预判定。于是 Meta 把控制层从系统层面独立出来,并在敏感行为上插入人工审批。看到这个结构,我认为评估代理产品时需要确认的问题变了:重点不再是它能做什么,而是它被禁止自行决定什么。
Oswarld视角
这次发布并不面向韩国市场。所以眼下国内需要决定的,不是要不要用 Muse,而是当这种设计成为消费级代理产品的基本语法时,我们该准备些什么。这次资料中,我认为可以直接落到实务中的有三点。
第一,供应商评估表需要分栏处理。这次发布中篇幅最大的文字,恰恰是尚未交付的功能。评审代理工具时,如果把已发布的功能和已宣布的计划写在同一行,判断就会被搅浑。已宣布的计划应当同时标注日期,并先确认这个日期是否已经过去,这样更稳妥。
第二,比起性能对比表,先做权限清单更贴近实务:对哪些系统只给只读权限、写入权限需要经过怎样的审批、权限的有效期设多久、哪些内容需要留存记录——Muse 的设计本身就是一份现成的清单。如果引入会议上没有这份清单,最终往往只会沦为比较模型分数。
第三,如果你正在运营支付或预约页面,现在是时候把自动化访问单独区分对待了。一旦能够自行登录并下单的代理产品大量普及,国内服务迟早也会迎来非人类的访问请求。到那时,我们的流程是拦截、是放行,还是加以区分处理,将直接关系到营收与事故应对。
我也要加一个保留意见。以上内容都是从 Meta 公开的设计与扎克伯格的发言中推导出的解读,这套结构在实际运营中究竟能撑多久,目前谁也说不准。Sentinel 究竟能过滤掉多少提示词注入攻击,也还没有外部验证结果。所以我打算盯着两件事再重新做判断:机密虚拟机是否真的会在年内推出,以及外部审计结果是否会公开。
结语
从现在起,我看代理产品时,会先看它被禁止独自做什么,而不是先看它能为你做什么的清单。关于 Muse,Meta 预告的机密虚拟机和外部审计结果,是我下一步判断的依据。
💬 如果 读者 所在的公司要给代理授权,您会把只读权限和写入权限的边界划在哪里? 📨 如果你身边有负责管理公司账户与权限的同事,请把这封信转给他们。可以借此机会提前讨论一下该如何处理代理账户。
参考资料与延伸阅读
核心来源
- Axios,“Meta debuts Muse, its long-planned personal AI agent”,2026 年 9 月 8 日。……最清晰地区分整理了 Sentinel 的判定方式、权限范围,以及机密虚拟机年内推出的计划
- Sources,“Mark Zuckerberg on Muse, Meta’s biggest AI bet yet”,2026 年 9 月 8 日。……以扎克伯格本人的话呈现了最小权限原则、招募 Marlinspike,以及关于奖励破解的发言
- CNBC,“Meta pushes into personal AI agents in Muse Spark family”,2026 年 9 月 8 日。……刊载了 Alexandr Wang 关于隔离环境与凭证处理的说明
背景知识
- IBTimes UK,“Meta Launches Muse, AI Agent That Can Send Emails, Book Tickets and Shop With Your Approval”,2026 年 9 月 8 日。……逐项整理了审计记录与外部审计计划
关联往期
