第 191 期

Claude 如何在文本中植入水印

图像可以在人眼无法察觉的空隙中隐藏信号,但文本却没有这种空间。本文梳理了通过改变模型选词方式来植入标记的原理,以及在短文和重写面前失效的局限性。

AI与科技Claude 如何在文本中植入水印

Anthropic 于 8 月 10 日披露的文本标记

8 月 10 日,Anthropic 在帮助中心悄悄上线了一篇文档。内容指出,2026 年 8 月 2 日之后发布的 Claude 模型将在生成的文本中植入机器可读的标记。据称该标记肉眼不可见,复制粘贴也能保留,并且能承受一定程度的编辑。

如果是图像,大家很容易理解。毕竟 Google DeepMind 的 SynthID 会在生成的图像中嵌入隐形水印,这早已为人熟知。但在语句中究竟如何隐藏看不见的东西?难道是在字里行间插入特殊字符吗?

文本很难像图像像素那样,找到即便发生微调也不会引起注意的空间。因此这项技术并没有在文章上附加标记,而是对模型挑选词语的方式本身做了极其轻微的调整。也就是说,标记并非额外附加在文本上的数据,而是蕴含在模型最终选择了哪些词语之中。


图像中有藏身之处,文字却没有

我们先来探讨一下,为什么图像水印相对容易让人直观理解。

数字图像是由数百万个像素组成的数值阵列。而人眼无法察觉这些数值之间的细微差异。某个像素的红色通道值无论是 137 还是 138,我们都无法分辨。音频也是如此。人耳存在难以听清的频段,而且在响亮的声音之后,往往会掩盖微弱的声音。

正因为人类感官无法区分这种细微差异,才留下了可以承载信息的留白。SynthID 系列图像水印正是将信号植入到这种留白之中。哪怕把原图和带有水印的版本放在一起并排对比,人类也感觉不出区别,但专用检测器却能识别出其中的微弱模式。甚至在已经生成的图像上后续叠加水印,也是完全可行的。

而文本中却没有这样的留白。

句子不是像素阵列,而是一连串 Token1 的排列。每一个 Token 都承载着明确的含义。在“今天天气很好”中稍作改动,换掉一个字,就会变成错别字或改变原意。像把 137 改为 138 那样无伤大雅的微调,在原理上是行不通的。虽然也有插入不可见 Unicode 字符的方法,但这更像是单纯的隐藏字符,称不上真正的水印。只要将其复制并粘贴到其他编辑器中,往往就会彻底丢失,而且想找出来删掉也极为容易。

因此,文本水印技术必须采取截然不同的路径:不是在写好的文章中植入信号,而是直接介入文字生成的过程。


于是,抽取词语的方式变了

语言模型并不会一气呵成地写完整篇文章,而是一个接一个地抽取Token。它在每个瞬间都会计算针对整个词表(通常超过10万个)的概率分布,并从中抽选一个。这里有一个关键事实:在绝大多数位置上,正确答案从来不止一个。

试想这样一句话:“这个问题的根源不在于技术,而在于___”。无论在此处填入“制度”、“结构”、“设计”还是“惯例”,句子读起来都完全通顺。将“所以”换成“因此”,或者把“这个节点”换成“这个环节”,读者也察觉不到任何异样。像这样选哪一个都无所谓的裕度,在每一个Token生成时都客观存在。在信息论中,这被称为熵2

文本水印正是把这种裕度当作通信信道来用。它使用的不再是像素的留白,而是选择的留白

Google DeepMind于2024年10月在《自然》(Nature)杂志上发表的SynthID-Text论文,最清晰地展现了这一结构。其运行方式如下:

前序Token + 密钥 → 哈希 → 随机数种子 → 评分函数 g1 · g2 · g3
8个候选 制度 结构 设计 惯例 方式 体系 框架 原理
 
g1比拼 结构 设计 方式 原理
 
g2比拼 设计 原理
 
g3比拼 设计
橙色单元格为实际输出的Token。论文默认设置为30层,此处简化为3层展示。

首先,将密钥与前序的几个Token一同输入哈希函数,生成随机数种子。利用这个种子,生成多个为词表中所有Token分配0或1的评分函数。接着,从模型的原始概率分布中抽选出多个候选Token,进行锦标赛式的比拼。两两配对,评分函数得分较高的一方晋级,在下一层再用另一个评分函数继续比拼,最终胜出的Token便是实际的输出内容。论文中的默认设置为30层。

fingerprint

由于候选Token原本就是从模型真实的概率分布中抽取的,**最终文本的质量几乎没有受损。**但对于掌握密钥的人来说,却能看出一处统计偏差:输出的所有Token,无一例外都集中在由该密钥生成的评分表中得分偏高的那一侧。

这样一来,检测过程就变得非常简单。既不需要原始模型,也不需要文本底稿。只需利用同一套密钥在观测到的文本上重新运行评分函数并计算平均分,然后计算“如果这是人类写出的文章,纯属巧合得出这一分数的概率”。这是一次统计检验。人类撰写的文本得分恰好落在随机水平,而嵌入水印的文本则会在统计学意义上明显偏离基准。

其计算成本也极其低廉。在同一篇论文中,锦标赛采样的延迟增加经测定仅为0.57%。这正是该方案能够部署到实际服务中的原因。事实上,Google已经将其集成到了Gemini中。

目前我们尚不清楚Anthropic是否严格采用了这种方案,**因为该公司并未公开其实现细节。**但其“直接织入文本本身”、“能随复制粘贴转移”、“经得起部分编辑修改”、“对质量毫无影响”这四点说明,与这一技术流派的特征完全吻合。该流派的原型是2023年Kirchenbauer研究团队提出的绿名单·红名单方案,而锦标赛采样正是其改良版本。


局限性也全由这同一原理决定

只要理解了这一结构,Anthropic文档中列出的所有局限性就能用一句话解释通。这并不是公司出于谨慎而附带的免责声明,而是在原理上必然如此的结果

它能在复制·粘贴中保留下来的原因,在于标记并非文件属性,而是词语选择本身。只要迁移文本,标记也会随之迁移。它根本没有像元数据那样会被剥离的部分。

它能经受部分编辑的原因,在于信号被微弱地稀释、分散在数百次选择之中。即便修改几句话,也只是统计值降低,并不会归零。

在短文本中失效的原因也是如此。因为是统计检验,所以需要样本量。查看SynthID-Text的实测数据,在50个token的长度下,以1%的误报率为基准,检测成功率会骤降至0.3附近。这意味着十来句话的短文很难做出判定。

它在改写3与翻译面前瓦解的原因格外耐人寻味。如果由人类或其他模型重写句子,token的选择就会通过一个与该密钥完全无关的过程被重新抽取。信号并不是被抹去了,而是被覆盖了

此外,还有一个文档中未曾提及的局限。我认为这才是最关键的一点:水印所能容纳的信息量受制于生成熵。 在选项只有一个的位置上,根本无法植入任何东西。毕竟如果候选词全都一样,就完全没有举行锦标赛的必要了。

因此,像简短的代码片段、固定格式的表格输出、引文、计算结果这类答案几乎唯一确定的文本,几乎附着不上任何标记。讽刺的是,恰恰在最激烈争论内容是否出自AI的领域,这项技术表现得最为脆弱。


韩国自1月起就已存在标识义务

这次发布并不仅仅牵涉到欧洲的监管。韩国国内其实也已经有了标识义务。

《人工智能发展与建立信任基础等相关基本法》及其施行令已于2026年1月22日施行。该法第31条规定,生成式AI经营者有义务标识生成结果由AI生成的客观事实。这里分两种情况:对于普通生成结果,可以在人类可识别的标识或者水印、元数据等机器可读方式中二选一;而对于深度伪造,则仅允许使用人类能清晰辨识的可视化标识。文本同样被包含在此类对象之中。

问题主要出在两点。第一,承担义务的主体并非个人用户,而是人工智能经营者。第二,即便想选择机器可读方式,实际上也根本没有可用的标准技术。因此,政府设立了至少1年以上的过渡引导期,最高3000万韩元的罚款征收实际上已被推迟至2027年之后。

Anthropic此番举措正与这一空白相关。在模型层面打上标记,意味着对于那些接入Claude打造产品的韩国本土经营者而言,机器可读标识成为了默认自带的功能。由于“缺乏标准”这一理由,可以说直接少了一个借口。

然而,法律所要求的与技术所传达的信息在此处发生了错位。韩国法律要求的是“标识由AI生成的事实”,而该水印所表达的内容却并非严格如此。正如该公司自行阐明的那样,凡是经过校对、翻译、摘要、格式转换的句子,全都会被标记为“经由Claude处理”。与欧洲相关指引将单纯的语法校对等辅助功能豁免于标识义务的做法相比,技术标注的范围显然宽于法律所要求的范围。

换言之,这一标记并非Claude撰写了该文的证明,而是曾由Claude处理过的记录。如果仅仅因为附带了标记就断定文章是Claude写的,难免会产生误解。


Oswarld视角

相比技术本身,让我思考更久的是检测密钥由谁掌握的问题。

这种水印在没有密钥的情况下是无法读取的。然而,一旦公开密钥,任何人都可以反向抹掉水印。因为只要知道哪些标记(token)的得分更高,特意挑出这些标记并加以替换即可。可要是保持不公开,“这篇文章是否由 AI 生成”的判定权就会高度集中在模型公司一家手中。

欧盟《实践规范》要求第三方也能够进行检测,但这两者在原理上是相互冲突的。现实可行的解法或许是由模型公司运营的检测服务,可这样一来,为了获得判定结果,就必须将待检测的文本发送给该公司。这意味着招聘专员需要把应聘者的求职信、学校需要把学生的作业上传到模型公司的服务器上,才能得到判定结果。为了透明度而打造的机制,反倒促成了新的数据集中结构。

在我制定市场进入(GTM)策略的过程中,曾多次见过类似的模式。企业在评估 AI 工具时往往先从性能对比表做起,但真正决定合同签署的,向来是那些原本不在表格上的项目。这次的水印同样属于此类项目。如果是使用 Claude API 构建文档处理产品的公司,就必须留意“客户输入了自己的文稿,而输出结果中却附带了可被检测的信号”这一项目。因为这是一个需要对服务条款与告知文案进行调整的事项。

不过,对于实际成效必须保持冷静的审视。想抹掉水印的人只需改写一次即可,或者直接改用不添加水印的模型便万事大吉。到头来,被打上标记的反而是遵守规则的一方。因此,比起将其视为抓捕滥用行为的手段,我更倾向于将这项举措看作一种基础设施:让守规矩的从业者所生成的日常内容,在默认状态下就附带上机器可读的标记


结语

总结下来大致是这样:

第一,图像中存在人类察觉不到的冗余空间,因而可以隐藏信号,但文本中并不存在这种空间。因此,文本水印并非在成稿之后贴上标记,而是微调模型挑选词语的方式。

第二,这一原理衍生出了其所有的特性:即便复制粘贴,标记依然存在;篇幅短小或答案近乎固定的文本几乎无法打上标记;而一旦重写句子,标记便会被覆盖并消失。

第三,遗留的问题与其说是技术层面,不如说是检测密钥由谁掌握并由谁判定。如果公开密钥,任何人都能抹除水印;如果不公开,判定权就会集中在某一家模型公司手中。本文所探讨的标记并非单独的文件元数据,而是体现在词语选择中的统计学模式。

眼下您可以做的事情其实出奇地简单。不妨列出目前所在组织中经由 AI 处理后流向外部的各类文本:新闻通稿、详情页、客户应答文案、合同草案。从中区分出“即便被打上‘AI 处理’标记也无伤大雅的内容”与并非如此的内容,未来需要梳理的政策轮廓便大致明晰了。

您在实际工作中是否也在借助 AI 撰写或润色文档并发送给外部?如果那些产出被打上“由 AI 处理”的标记,最让您感到棘手的文档会是哪一类?欢迎在评论区分享。如果收集到足够的案例,我们将在下一期中梳理针对不同文档类型,标记究竟会带来何种风险


💬 如果被打上标记,最让您感到棘手的文档会是哪一种?欢迎在评论区留言,我们将在下一期中予以参考。 📨 如果您身边有负责内容、法务或研发的同事,欢迎将这篇文章转发给他们。


参考资料与延伸阅读

核心来源

  • Anthropic, “How Claude marks AI-generated content”, Claude Help Center, 2026年8月10日。 查看文档 ··· 这是今天文章的出发点。篇幅不长,建议阅读原文。尤其是“Limitations”一节,展示了这家公司并未承诺什么。
  • Sumanth Dathathri et al., “Scalable watermarking for identifying large language model outputs”, Nature, Vol. 634, 2024年10月24日,pp. 818–823。 查看论文 ··· 这是今天机制解析的依据。光是看一眼图2的锦标赛示意图,就能领会其原理。顺便提一句,有不少二次文献将这篇论文引用为第631卷第755页,那是另一篇论文的文献信息。
  • John Kirchenbauer et al., “A Watermark for Large Language Models”, ICML, 2023。 查看论文 ··· 这是该技术脉络的雏形。采用绿名单与红名单这种最简单的形式,理解起概念来反而更容易。
  • 《人工智能发展与建立信任基础等相关基本法》第31条及该法施行令,2026年1月22日施行。 查看法规 ··· 这是韩国国内标注义务的依据条款。深度伪造与普通生成内容的标注方式如何区分,是其中的核心。
  • European Commission, “Transparency obligations under Article 50 of the AI Act”, 2026。 查看官方FAQ ··· 可在一手资料中确认第50条的适用时间(2026年8月2日)以及实践守则的定位。

背景知识

  • Coalition for Content Provenance and Authenticity, C2PA Specification查看规范 ··· 这是文件端标识的标准。光是浏览一下其签名结构,就能明白为什么“剥离掉就万事大吉”。
  • Nikola Jovanović, Robin Staab, Martin Vechev, “Watermark Stealing in Large Language Models”, ICML, 2024。 查看论文 ··· 探讨了逆向推断水印并将其抹去或伪造的攻击手段。如果想从技术角度深挖今天文章提到的“检测密钥”问题,建议从这里入手。

安光涉(Oswarld)个人插画

作者 安光涉(Oswarld) 现任世宗大学兼任教授,INLEVEL9 战略顾问。职业经历、研究、著作与近期活动会持续更新在作者简介。 最新动态 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

📝 术语说明

注释

  1. Token(词元):语言模型处理文本的最小单位。可以是一个完整的词,也可以是词的一部分。模型并不是整句撰写,而是通过将这些词元逐一拼接来生成文本。

  2. Entropy(熵):衡量某个位置上可能出现的选项有多丰富的度量值。如果下一个可能出现的词候选众多,熵就高;如果实际上只有一个确定选项,熵就低。水印只能藏在熵值较高的位置。

  3. Paraphrase(改写):在保持原意不变的前提下改变表达方式重新撰写。由人工手动润色重写,或是丢给另一个AI重新洗一遍,都属于此类。