9秒内结束的AI事故,问题在于检测与恢复时间
通过AI Agent的数据删除事故与维纳1960年的论文,探讨人该如何争取察觉问题并进行恢复的时间
商业生产数据库与备份消失仅用了9秒
2026年4月26日,美国一家小型SaaS初创公司PocketOS发生了一起事故。正在调整测试环境的AI编程Agent为了“解决问题”自行做出判断,删除了云卷,而该卷恰好与生产数据库相连。备份也位于同一个卷上。整个过程仅耗时9秒。
媒体报道的标题大体上都是“AI搞垮了公司”这类方向。但我在这起事故中,始终对另一个数字耿耿于怀——那就是9秒。这个时间比人看一眼屏幕、察觉异常并伸手制止所需的时间还要短。
这起事故的根源并不在于AI变得有多聪明,而在于速度差:机器在以秒为单位执行命令,而人根本来不及在这期间厘清状况并予以制止。同样的诊断,早在66年前就有人提出来了。
1960年5月维纳的论文:因人类太慢,控制终将失效
诺伯特·维纳是开创了控制论1的数学家。1959年12月,他在芝加哥举行的美国科学促进会年会上做了一场演讲,随后整理文稿,于次年5月发表在《科学》杂志上。文章题为《自动化的某些道德与技术后果》。
论文的副标题是这样一句话:
“机器在学习的过程中,能够以令其程序员猝不及防的速度发展出意料之外的策略。”
那是在1960年。维纳当时列举的论据是IBM的西洋跳棋程序。据他观察,这个程序在学习大约10到20个小时之后,棋力就明显超过了编写它的程序员。以今天的标准来看,这只是个微不足道的案例。但维纳从中得出的结论却绝非小事。
“仅仅因为我们人类的行动迟缓这一事实,我们对机器的有效控制就可能归于无效。等我们对感官传来的信息做出反应并把正在开着的车刹停时,车子可能早就一头撞在墙上了。”
接着,他又斩钉截铁地写道:
“机器在理论上会接受人类的批判。然而,这种批判可能只有在有效时机早已过去很久之后才能做出。”
论文中甚至专门设有一个名为“时间尺度(Time Scales)”的小节。维纳指出,学习型机器之所以变得危险,最核心的原因只有一个:人类与机器在全然不同的时间尺度上运行,而两者若不产生剧烈摩擦,就无法咬合在一起。
维纳在接下来的这句话中明确阐述了这一点:
“每当两个控制主体在截然不同的时间尺度上协同运行时,都会产生同类的问题。哪一方更快、哪一方更慢并不重要。”
也就是说,维纳的诊断并非“机器太快所以危险”。而是速度差异本身让控制归于无效。作为证据,他还举了一个反方向的例子:个体科学家与科学史的关系。在科学这一漫长进程中,50年犹如个体的一天,因此个体科学家只能看清自己所参与历程中极小的一块碎片。这属于机器偏慢的情况,但在此控制也同样变得困难。
以秒为单位结束的三个近期案例
现在让我们来到66年后的今天。我们来看三个机器在人类毫无插手余地的情况下就已完成全部操作的案例。
第一,9秒。 这就是前面提到的 PocketOS 事件。这里的关键不在于智能体是否怀有恶意,而在于破坏性命令在未经确认程序的情况下即可直接执行的架构。这家公司最终只得以3个月前的备份进行了部分恢复,此后的记录则正在通过人工重新补录。
第二,每秒多起。 这是 Anthropic 于2025年9月中旬侦测到并在11月公开报告的一起网络间谍行动案例。约有30家机构沦为目标,用报告中的话来说,就是“AI独立执行了约80~90%的整体战术任务”。人类介入的主要决策仅包括以下几项:批准是否从侦察转入实际渗透、批准是否利用窃取的账户进行横向移动,以及决定窃取数据的范围。其余操作均由 AI 在未经人类确认的情况下接连处理。原本需要熟练人员耗费数月的工作,被压缩到了短短几天之内。
第三,89%。 根据今年2月援引高盛等机构的韩国媒体报道,全球金融市场约89%的交易由算法完成,每日规模至少达3.7万亿美元。2010年的闪崩(Flash Crash)2就曾展示过这个市场会如何崩溃:道琼斯指数在短短5分钟内暴跌约1000点,1万亿美元市值蒸发殆尽。5分钟,对于交易员来说连搞清楚发生了什么都远远不够。
这三个案例的共同点显而易见。没有一个是由于“AI比人类更聪明”而导致的。它们的共同之处全部在于:在人类察觉局势、做出判断并采取行动之前,事件就已经结束了。这正是维纳所说的那辆已经撞在墙上的汽车。
比停止按钮更棘手的问题:维纳的共济失调比喻
然而,在这篇论文中,最让我久久不能释怀的不是汽车,而是另一个比喻。维纳借用了一个神经生理学术语:共济失调3。
“用神经生理学的语言来说,共济失调带来的剥夺感丝毫不亚于瘫痪。”
共济失调患者的肌肉和运动神经都没有任何问题。力气尚在,指令也能传达。然而,**告诉自己身体当前处于何种姿态、当前承受的力量是否足以让人跌倒的感觉机制却失灵了。**因此他们无法站立。维纳表示,这种状态与瘫痪无异。
随后他立刻补充道:
“为了避免灾难性后果,仅凭我们采取的某种行动足以改变机器的轨道是不够的。因为很有可能,我们根本就不掌握足以让我们考虑采取该行动的信息。”
问题的核心不在于是否有停止按钮,而在于能否及时知晓按下的理由。用今天的词汇来说,这就是可观测性4的问题。
这里还叠加了人类自身的一项缺陷:自动化偏见5。在医疗信息学领域常被引用的戈达德(Goddard)研究团队于2012年发表的系统评价将其总结为:长期与大体准确的自动化系统协同工作,人类就会放弃对结果进行独立验证。当批准请求反复出现时,人们就可能不读内容直接点击同意。这并非因为懒惰,而是此类环境设计带来的必然结果。
《欧盟人工智能法案》已将这一问题写入法条。第14条第4款在列举高风险AI监管人员应具备的能力时,并列规定了“持续意识到可能陷入自动化偏见”以及“能够通过停止按钮等手段使系统在安全状态下停止运行”。维纳在1960年写下的两句话,在60多年后终于变成了法律条文。
问题在于,法条并不能凭空为人创造所需的时间。**在短短9秒内就结束的事件中,就算有停止按钮,也没有时间去按。**只有确保人类拥有察觉异常并做出判断的时间,停止按钮才能真正发挥作用。
那么,我们究竟应该设计什么
维纳在文末讲了一个瓶子工厂的故事。如果按照最大生产率来对工厂进行程序设定,那么当老板意识到早在6个月前就该停产时,工厂可能已经因为滞销的瓶子堆积如山而破产了。尽管机器只是完全照章办事、分毫不差。
我认为从中可以提炼出三条实操原则。
第一,与其降速,不如构建可回滚的架构。 自动化的优势就在于速度,如果为了安全而牺牲速度,引入自动化的理由也就不复存在了。相反,将可逆操作与不可逆操作区分开来,几乎不会拖慢速度。在PocketOS事故中,真正致命的并不是删除本身,而是备份与源数据位于同一卷上这一事实。一旦完全失去了回滚手段,无论事故发生得快还是慢,都会留下难以恢复的死局。
第二,减少确认请求,确认才能真正发挥作用。 频繁弹出确认窗口看似是安全措施,实则适得其反。当请求不断重复出现时,人最终会看都不看就直接点击批准。将确认集中在少数不可逆的破坏性操作上,其余操作允许免确认执行,这远比增加确认的总量更为安全。
第三,设计在执行过程中能让人及时察觉的信号。 这是对前文提到的共济失调开出的药方。事故发生后留下的审计日志,就像人在摔倒之后才告知当时的姿势一样无济于事。我们真正需要的是在作业执行期间持续指示当前状态的信号。在实务中,这通常表现为异常检测告警与自动熔断阈值这两者的组合。
此外,还有维纳在整篇论文中反复提及的一记警钟。他接连搬出《魔法师的学徒》、《一千零一夜》中的渔夫与魔鬼、W. W. 雅各布斯的《猴爪》,作出了如下总结:
“我们最好先弄清楚,赋予机器的目标是否真正符合我们的愿望,抑或只是某种华丽的仿冒品。”
这一深刻见解,与如今旨在让AI追求的目标契合人类真实意图的对齐(Alignment)讨论遥相呼应。
Oswarld视角
在制定 GTM 策略的过程中,我反复见过一种规律:关于技术“将改变什么”的预测往往大体准确,但关于“何时以何种路径改变”的预测则几乎全盘皆错。 因此,在阅读年代久远的预测文献时,比起结论,我总是先看结构。
维纳并不完全符合这个规律。在时间节点上,他错得离谱——毕竟在 1960 年,他所见过的尖端技术不过是一个西洋跳棋程序。但在结构上,他却预测得丝毫不差。我思考过这究竟是为什么,答案似乎很简单:维纳预测的从来不是机器的能力,而是人与机器之间的关系。 能力或许难以预测,但关系的结构却是可以被预见的。因为自 1960 年以来,人类的反应速度没有变快哪怕一分一毫。
最近去参加 AI 落地工作坊时,我被问得最多的问题是“究竟该自动化到什么程度”。不知从何时起,我不再直接回答这个问题,而是反问:“如果它跑偏了,你们需要几分钟才能察觉?恢复原状又需要几分钟?” 能立刻给出这两个数字的企业,出乎意料地少之又少。自动化范围在文档里写得清清楚楚,但检测时间和恢复时间却在任何文档中都找不到踪影。
正因如此,我认为眼下真正的危险并不是“AI 取代人类”。监督责任在人,但实际的判断与执行却由机器以人类无法企及的速度完成——处于这种状态,反而要危险得多。那是一种名义上写着“有人监督”,运转速度却让监督在物理层面上变得毫无可能的结构。
维纳曾用“主人与奴隶的悖论”来解释这一点。我们既希望奴隶足够聪明、能把事情办妥,又希望他们完全服从,但绝对的服从与完备的智能根本无法兼得。而这,恰恰就是我们如今对智能体(Agent)提出的苛求。
结语
总结一下。第一,最近的 AI 事故不是智能的问题,而是时间尺度的问题。事件结束得比人类的认知速度更快。第二,这一诊断维纳早在 1960 年就已经完成了,而他开出的药方不是停止按钮,而是“及时知晓按下理由的能力”。第三,因此实务的焦点不应是自动化范围,而应转移到检测时间与恢复时间这两个数字上。
建议您这周只尝试做一件事。挑选一个目前正在运行的自动化流程,在旁边写下两个数字:出错时察觉需要几分钟,回滚需要几分钟。两者的总和,就是事故发生时错误状态持续的时间。相比自动化范围,这个总和重要得多。
在实际工作中,您是否也曾因为给智能体或自动化脚本放权,而经历过“差一点就酿成大祸”的惊险瞬间?那是什么权限,察觉异常又花了多久?欢迎在评论区分享。如果收集到足够的案例,我将在下一期梳理不同权限类型分别潜藏着怎样的风险。
💬 欢迎在评论区分享您放权给智能体时惊心动魄的瞬间,以及察觉异常所花费的时间。我会在下一期中予以整理。 📨 如果您身边的同事也在运行自动化管线,不妨将这篇文章分享给他们。
参考资料与延伸阅读
核心来源
- Norbert Wiener, “Some Moral and Technical Consequences of Automation”, Science, Vol. 131, No. 3410, 1960年5月6日, pp. 1355–1358. 链接 ··· 本文的核心骨架。其底本是1959年12月27日维纳在AAAS芝加哥大会上的演讲,全文仅有四页,直接阅读原文也毫无压力。推荐从“Time Scales”一节开始读起。
- Anthropic, Disrupting the first reported AI-orchestrated cyber espionage campaign, 2025年11月. 链接 ··· 详细梳理了“80%~90%独立执行”以及人类介入的三个关卡分别在何处。不过考虑到发布报告的主体正是该模型的开发商,阅读时建议保留适度批判视角。
- 《“基于Claude的编码智能体误操作致使公司整个数据库被抹除”》,《AI Times》,2026年4月28日。 链接 ··· 9秒事件的事实经过。备份存放在同一卷上,才是这起事故的真正元凶。
- 《占全球交易的89%……“算法交易”成股市与黄金暴跌主凶》,《edaily Marketin》,2026年2月13日。 链接 ··· 算法交易占比与闪崩数据的来源。引用的指标来自多家机构的估算,更稳妥的做法是将其理解为一个大致区间。
背景知识
- Kate Goddard, Abdul Roudsari & Jeremy C. Wyatt, “Automation bias: a systematic review of frequency, effect mediators, and mitigators”, Journal of the American Medical Informatics Association, 19(1), 2012, pp. 121–127. 链接 ··· 讨论自动化偏差的标准参考文献。虽然这是一项针对医疗现场的研究,但其结论可以直接迁移到其他领域。
- 《Article 14: Human Oversight》,EU Artificial Intelligence Act. 链接 ··· 仅阅读第4款 (b) 与 (e) 项就足够了。自动化偏差与停止按钮并列收录在同一条款之中。
- Norbert Wiener, The Human Use of Human Beings, Houghton Mifflin, 1950. 链接 ··· 维纳将今天这篇论文的观点扩展为大众读物篇幅的著作。如果您喜欢那篇论文,不妨顺着这本书继续读下去。
📝 术语说明
注释
-
控制论(Cybernetics):试图用一套统一框架来解释生物、机器或组织中控制与信息交互方式的学科。维纳于1948年为其定名,当下的控制工程、人工智能与系统理论皆源自于此。 ↩
-
闪崩(Flash Crash):指由于各算法交易相互触发连锁反应,导致市场在几分钟内急剧下挫而后又几乎全盘修复的现象。2010年5月6日的美股闪崩便是最典型的案例。 ↩
-
共济失调(Ataxia):在肌肉与运动神经并无异常的情况下,因感知自身肢体位置与发力程度的感觉受损,导致无法自主协调运动的状态。患者无法站立并非因为缺乏力量,而是因为丧失了感觉。 ↩
-
可观测性(Observability):指仅凭系统向外输出的信号,就能推断其内部正在发生何种情况的程度。这与简单堆积海量日志不可同日而语,其衡量标准在于能否及时洞察潜在问题。 ↩
-
自动化偏差(Automation Bias):指由于自动化系统大多时候都是正确的,导致人类逐渐放弃自行核验其输出结果的倾向。这一偏差的棘手之处在于:系统越精准,人类的这种依赖反而越顽固。 ↩
