第 284 期

会摧毁供应链的产品——制造方自己先写了下来

微软、OpenAI内部文件在法庭上被公开

商业会摧毁供应链的产品——制造方自己先写了下来

比“史上最大规模劳动盗窃”留存更久的一句话

上月17日(当地时间),在《纽约时报》对OpenAI和微软提起的版权诉讼中,一部分此前被封存的文件被公开了。各家媒体的报道标题几乎都用了同一句话——微软应用科学总监Brent Hecht据称在2023年1月的内部备忘录中写下的表述:“人类历史上最大规模的劳动盗窃”。

这确实是能当标题的一句话。但我在同一个人写下的另一句话上停留了更久——大语言模型是摧毁自身供应链的产品这句话。据悉,微软内部文件中也有类似意思的段落:最终产品威胁到核心供应商的经济基础,这种情况极为罕见,而我们在LLM业务上恰恰造就了这种局面。

“盗窃”是伦理的语言,是要在法庭上争辩的词。“供应链”则是商业的语言。今天我想聊聊后一种说法——公司内部知道了什么、用数字确认了什么,以及明明知道,却为何没有朝着留住供应方的方向行动。

已公开文件中写下的内容

先来梳理一下都公开了些什么。这起诉讼是《纽约时报》于2023年12月提起的,如今还有包括《纽约每日新闻》在内的另外11家媒体一同参与。纽约南区联邦地区法院的Sidney Stein法官正在审查简易判决1申请,过程中文件正一点点被公开出来。

这次公开的内容大致可以分成三条线。

第一是规模。据原告方书面材料称,仅OpenAI的一个中间训练数据集中,就收录了超过9万1,692篇原告媒体的文章副本;而在从Common Crawl2中筛选出的一个数据集里,仅nytimes.com的文档就超过200万份。原告方的主张中还包括绕过付费墙、并从训练数据中删除版权声明的相关情节。其中一例是:一名OpenAI研究员报告了一个绕过《纽约时报》付费墙的“黑科技”,格雷格·布罗克曼总裁回复道:“啊,不错。”

第二是内部的担忧。除了Hecht的备忘录之外还有别的。主导ChatGPT开发的Nick Turley在2023年6月的备忘录中写道,AI对新闻媒体构成了存在性的威胁;到2024年2月,他又写道AI产品越好,就会越发具有替代性。2020年,时任OpenAI政策总监的杰克·克拉克曾给萨姆·奥特曼和布罗克曼发过一份备忘录,称公司将会打造出一套取代那些创造社会文化之人劳动的系统。克拉克后来离开公司,与人共同创立了Anthropic。

第三是高管的证词。微软CEO萨蒂亚·纳德拉在证词记录中表示,付费墙背后的内容,无论是谁想要使用,都必须获得授权许可。他还表示,如果当初知道OpenAI抓取了付费墙背后的信息用于训练,他会行使要求模型重新训练的权利。

不过阅读时有两点需要留意。这次公开的内容中,相当一部分并非原始证据,而是**《纽约时报》一方书面材料中引用的节选**。原始文件目前仍处于封存状态,也就是说,这些都是脱离前后语境被截取出来的句子。此外,微软反驳称,Hecht的备忘录不代表公司立场。在法庭书面材料中,微软解释说他并非决策者,而是被雇来提供不同视角的研究人员。OpenAI没有回应置评请求。

比“盗窃”更沉重的词是“替代”

标题虽是盗窃,但我认为在审判中真正有分量的词另有其物。是“替代”。

OpenAI 和微软的辩护逻辑是美国版权法中的合理使用3。他们的主张是:将文章用于训练,是对原作进行了充分转化,生成了新的东西,而非损害原作市场价值的替代品。法院在判断合理使用时会考量的因素之一,正是这种使用对原作品市场造成的影响。

然而这次的文件里,反复出现了公司内部使用的“替代”一词。被窃取内容训练出的 AI 产品,被写成“基本上是替代性的”,后面还加了一句“就这样,完了”。2023 年 2 月,OpenAI 的一名工程师曾写信告诉同事,无论链接展示得多显眼,用户也不会点击。微软自己的数据显示,Copilot 的回答引擎相较原有的必应搜索,将 nytimes.com 的点击率最多拉低了 93%,这一点也写进了诉状里。

关于链接的这个话题,我们的通讯之前也谈过几次。谷歌向出版商推出“首选来源”按钮时,我们也曾引用过外部调查——一旦附上 AI 摘要,链接点击量几乎腰斩。这一次不同的地方在于来源。这次不是外部调查机构,而是产品制造方自己的内部数据和工程师亲笔写下的句子。“附上来源链接就能带回流量”这种说法,制造方自己都不曾先信过。

谷歌首选来源按钮不会告诉你粉丝数 · 第210期 · INLEVEL9我们梳理了谷歌公开的首选来源嵌入按钮的内容,以及为何出版商无法确认自己网站被指定的读者数量与流量来源inlevel9.com

不过,我们不能就此提前预判诉讼的结果。到目前为止,美国法院在这类案件上大体倾向于将 AI 训练视为合理使用,本月初,特朗普政府还提交了支持 OpenAI 一方的意见书。缺乏上下文的摘录,在审判中完全可能被解读成不同的意思。只是,一家主张“这是转化而非替代”的公司内部,出现了“是替代,完了”这样的句子,这一事实不论判决结果如何,都已经留在了记录里。

拖垮供应商的买家

现在回到供应链的话题。

从经营者的角度看,核心供应商垮掉首先是生存问题,其次才是伦理问题。去年8月我写SanDisk的故事时,看到的正是相反的一幕。搭建AI数据中心的客户与NAND供应商签订了长达4年以上的合同,甚至设下165亿美元规模的担保,一旦违约资金就会立刻转移。因为零部件一断供,自己的生意就会停摆,所以是买家先出钱来保障供应商的生存。

SanDisk的4年合同,165亿美元担保 · 第183期 · INLEVEL98家客户率先要求签订4年以上的供货合同,并提出165亿美元的财务担保inlevel9.com

Hecht文件有意思的地方在于,它把这套逻辑原封不动地套用到了内容上。他把Copilot导致媒体点击量下滑的现象称为“毁灭的循环”。媒体一旦变弱,优质文章就会减少;优质文章减少,模型性能也会下滑,整个网络都会随之变差。与其说这是伦理呼吁,不如说是对我方产品原材料供应的警告。

但与半导体不同,在内容领域,买家并没有留住供应商。文件本身并没有直接回答为什么会这样。从这里开始是我的解读,我认为有两个原因叠加在一起。

一个是时间差。NAND今天一断,服务器今天就停。而文章早已积累了数十年的存量供模型训练,供应商垮掉的代价要到几年后才会显现。另一个是供应商的数量。NAND供应商屈指可数,但写文章的地方却数不胜数。哪怕一家垮掉,眼下看起来也总有替代品。这两个条件一旦叠加,即便明知供应链正在崩塌,今天就掏钱的理由也会变得薄弱。

在此期间,供应商一方的价码开始靠诉讼和个别合同来确定。有的媒体像新闻集团那样与OpenAI签下了大额合同,也有像我这样把一本书授权用于AI训练、拿到几百美元的作者。不过这与其说是设计出来的供应链,不如说更像是眼看着供应链崩塌、临时东拼西凑出来的补丁。

Oswarld视角

在这份文件里,我看得最久的段落其实是另一处。是微软对赫克特(Hecht)的说明。说他是被雇来提出不同意见的人,而不是决策者。

supply chain作为辩护逻辑,这话说得通。但如果把它当作组织设计来读,就显得奇怪了。公司雇了一个人专门提出反对意见,那个人也确实做了这件事,可到头来公司却说这不代表公司立场。这也可以读成一种坦白:警告确实存在,但没有抵达做决定的那个位置。纳德拉的证词也是同样的形状。他说如果知道的话会要求重新训练,反过来说就是本可以知道的信息,没有送到他的桌上。当然,证词就是证词,也可能只是一种自我保护的说法。

再把克拉克(Clark)2020 年的备忘录摆到一起看,画面就更清晰了。警告不止一次,也不只出现在一家公司里。2020 年、2023 年、2024 年,两家公司内部反复写下方向相同的句子。可即便如此,方向也没有改变。

如今那些引入 AI 的企业,常常会设立一些职位:伦理委员会、红队、负责任 AI 负责人之类。我认为这类职位是必要的。只是这个案例说明的是:设立一个可以提出反对意见的岗位,和搭建一条让那个意见能够抵达决策的通路,是完全不同的两件事。如果没有这条通路,那份备忘录往往要等到几年后的法庭上,而且还是作为对方的证据,才第一次被认真读到。

所以我觉得,不如先这样问一家组织:“这会摧毁我们的供应链”这样的备忘录一旦被写出来,它会在谁的桌上停下来?

结语

这份文件并不能决定判决结果。摘录缺乏语境,法院依然倾向于支持合理使用。但可以确定的是,在 AI 公司内部使用的措辞,比外部的批评更准确地指出了问题所在。比起“盗窃”这个词,更值得注意的是“供应链”这个词。


💬 在 读者 所在的组织里,内部的反对意见是否有一条能走到决策层的路径?如果曾有过顺着这条路径、方向真的因此改变的经历,或者最终未能抵达的经历,欢迎在评论区分享。

📨 如果身边有正在考虑引入 AI 或从事内容业务的同事,请把这篇文章转发给他们。


你的观点会成为下一期的线索

欢迎留下你的经验与看法。

注册读者均可免费发表评论。

参考资料与延伸阅读

核心来源

推荐搭配阅读的往期内容


安光涉(Oswarld)个人插画

作者 安光涉(Oswarld) 现任世宗大学兼任教授,INLEVEL9 战略顾问。职业经历、研究、著作与近期活动会持续更新在作者简介。 最新动态 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI。

📝 术语说明

注释

  1. 简易判决(summary judgment):当事实层面不存在实质性争议时,法官无需走到正式庭审(陪审团审理)阶段,仅凭法律问题作出裁定的程序。由于双方都会在这一阶段积极提交对自己有利的证据,被封存的文件往往就是在这时候浮出水面的。 ↩

  2. Common Crawl:一个大规模抓取网页并免费公开的非营利档案库。许多AI研究机构都以它作为训练数据的起点。 ↩

  3. 合理使用(fair use):美国版权法中的一项原则,允许在评论、报道、戏仿等特定情形下,无需获得许可即可使用受版权保护的作品。判断时需要综合考量四个因素:使用的目的与性质、原作品的性质、使用的篇幅比例,以及对原作品市场造成的影响。 ↩