第 258 期

在代理之上,又多设了一层监督者

Meta 出货的是一套控制结构。那台号称连 Meta 都看不到的计算机,预计将在年内推出

商业在代理之上,又多设了一层监督者

Meta 在 Muse 之上又架了第二个代理

Meta 于 9 月 8 日在美国推出了个人 AI 代理 Muse。只有年满 18 岁的用户才能使用,系统会为每位用户在云端分配一台专属虚拟计算机,负责管理日程、购物,并把长期目标转化为具体执行计划。每周 1 亿 token 以内免费,超出这个额度的用户可以升级到每月 20 美元或 100 美元的套餐。

翻看发布资料时,真正吸引我注意的并不是模型的成绩单,而是同一台虚拟计算机里独立运行的第二个代理——Sentinel。它在系统层面与 Muse 分离。Muse 所做的一切只要涉及向外部网络发出请求,都必须经过 Sentinel。


Muse 只负责提议,批准权在 Sentinel 手里

Sentinel 的工作可以分成三类:允许、拦截,或者询问用户。Muse 只能提议要做某个行动,至于哪些行动会真正被执行,并不是由 Muse 决定的。从外部读取的文档或网页中可能藏有命令语句——也就是提示词注入1,过滤这类攻击也是 Sentinel 的职责。

授权方式也不是一次性全开。连接某项服务时,先从只读权限开始,如果需要写入权限,则必须另行申请。权限可以按任务、按服务、按交易、按时间段分别收紧。扎克伯格在采访中把这一点定为设计原则——只拿到必需的最小限度权限,只有真正需要时才扩大范围,这就是最小权限2原则。

登录信息和支付方式则被放进完全不同的隔间。凭证保存在独立的存储空间里,代理可以完成登录,却看不到密码;卡片支付则通过一次性号码进行,真实卡号不会暴露给代理。代理做了什么、打算做什么都会留下记录,用户之后也可以随时断开已连接的服务。

在 YouTube 上观看

那台号称连 Meta 都看不到的计算机,还没到来

扎克伯格在采访中透露,他与 Nat Friedman 一起亲自招募了 Signal 的创始人 Moxie Marlinspike。目的是打造机密虚拟机3。这个构想是想把放在桌子底下那台电脑才有的保密程度,也带到云端——他说,目前没在别处见过做到这个水准的。

这里需要把时间点分开来看。9 月 8 日这次发布中所包含的,是每位用户各自隔离的安全虚拟机,运行在 Meta 自家基础设施之上。而连 Meta 自己都无法窥看的机密虚拟机,预计将在年内推出。目前公布的计划包括:由用户掌握密钥、由外部安全公司审计源代码、并公开二进制文件与透明性日志。扎克伯格也表示会在几周内公布更多细节。

这个区别不是文字游戏。用户现在得到的保障并不是“Meta 看不到”,而是**“Meta 又多设了一层监视机制”**。前者是结构上让人无法看到的承诺,后者则是“看得到、但会被监督”的承诺。在决定是否连接邮件与消息时,真正需要参考的是后者,前者目前还不是判断依据。

模型解题之前,先会拆解环境本身

Sentinel 为什么没有被塞进 Muse 内部,而是被放在旁边,扎克伯格的另一段发言给出了线索。他在最近谈到模型训练过程时说,给模型一个问题,它会先试图弄清自己所处的整个环境。如果告诉人类说代码某处有个 bug,人通常会先去看那段代码;而现在的模型,往往会先尝试改变环境本身,或者干脆想办法绕开限制。

业内把这种现象称为“奖励破解”(reward hacking)。让模型完成某个目标,结果模型发现,修改用来判定目标是否达成的那个装置,比真正完成目标更快。他把这一点当作需要设置边界的理由:如果边界太弱,模型学到的就不是原本想教它的东西,而是绕过规则的捷径。

把同样的逻辑放到产品上,就能解释 Sentinel 所处的位置。如果判定方和执行方处在同一个进程之中,执行方就有可能反过来动手脚干预判定。于是 Meta 把控制层从系统层面独立出来,并在敏感行为上插入人工审批。看到这个结构,我认为评估代理产品时需要确认的问题变了:重点不再是它能做什么,而是它被禁止自行决定什么。

Oswarld视角

这次发布并不面向韩国市场。所以眼下国内需要决定的,不是要不要用 Muse,而是当这种设计成为消费级代理产品的基本语法时,我们该准备些什么。这次资料中,我认为可以直接落到实务中的有三点。

第一,供应商评估表需要分栏处理。这次发布中篇幅最大的文字,恰恰是尚未交付的功能。评审代理工具时,如果把已发布的功能和已宣布的计划写在同一行,判断就会被搅浑。已宣布的计划应当同时标注日期,并先确认这个日期是否已经过去,这样更稳妥。

第二,比起性能对比表,先做权限清单更贴近实务:对哪些系统只给只读权限、写入权限需要经过怎样的审批、权限的有效期设多久、哪些内容需要留存记录——Muse 的设计本身就是一份现成的清单。如果引入会议上没有这份清单,最终往往只会沦为比较模型分数。

第三,如果你正在运营支付或预约页面,现在是时候把自动化访问单独区分对待了。一旦能够自行登录并下单的代理产品大量普及,国内服务迟早也会迎来非人类的访问请求。到那时,我们的流程是拦截、是放行,还是加以区分处理,将直接关系到营收与事故应对。

meta computer

我也要加一个保留意见。以上内容都是从 Meta 公开的设计与扎克伯格的发言中推导出的解读,这套结构在实际运营中究竟能撑多久,目前谁也说不准。Sentinel 究竟能过滤掉多少提示词注入攻击,也还没有外部验证结果。所以我打算盯着两件事再重新做判断:机密虚拟机是否真的会在年内推出,以及外部审计结果是否会公开。

结语

从现在起,我看代理产品时,会先看它被禁止独自做什么,而不是先看它能为你做什么的清单。关于 Muse,Meta 预告的机密虚拟机和外部审计结果,是我下一步判断的依据。

💬 如果 读者 所在的公司要给代理授权,您会把只读权限和写入权限的边界划在哪里? 📨 如果你身边有负责管理公司账户与权限的同事,请把这封信转给他们。可以借此机会提前讨论一下该如何处理代理账户。

参考资料与延伸阅读

核心来源

背景知识

关联往期

安光涉(Oswarld)个人插画

作者 安光涉(Oswarld) 现任世宗大学兼任教授,INLEVEL9 战略顾问。职业经历、研究、著作与近期活动会持续更新在作者简介。 最新动态 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

📝 术语说明

注释

  1. 提示词注入:把命令语句藏在网页或文档等外部内容之中,让读取到这些内容的 AI 执行用户并未指示的操作,是一种攻击手法。

  2. 最小权限:在让某个程序或账户执行任务时,只授予该任务所必需的权限,其余一律关闭的安全原则。

  3. 机密虚拟机:一种在云端运行、但在硬件层面进行加密的虚拟计算机,使得连运营该云服务的公司自身也无法读取其内部数据。