第 195 期

AI检测器把《独立宣言》也判定成了AI代写

斯坦福大学的一项研究发现,非母语者的91篇托福作文中有61.3%被误判为AI代写,1776年的《独立宣言》也被判定为95%~100%出自AI。本文梳理了为何绝不能将检测得分当作确凿证据。

社会AI检测器把《独立宣言》也判定成了AI代写

故意把个人陈述改得“没那么完美”的人们

在美国爱达荷州立大学攻读化学专业的Lauren Jaeger(音译)在申请博士项目时,看到了一条奇怪的警告。部分申请系统提示称:“一旦在个人陈述中检测到AI撰写的痕迹,整份申请将被作废。”Jaeger从未使用过AI。然而,出于不安,她把自己的文章放进了几个在线检测器中,结果全都不约而同地显示“几乎100%由AI生成”。

Jaeger最终重写了个人陈述。但这次修改并不是为了写得更好,而是为了不被检测器抓出来,故意写得“没那么完美”。据说她就这样把检测得分降到了30%,心想“这样应该差不多了”才提交了上去。(幸运的是,她最终被犹他大学的博士项目录取了。)

与此同时,互联网上还流传着一件更加荒唐的轶事。有人把写于1776年的美国《独立宣言》输入某款检测器,结果竟然被判定为“95~100%由AI撰写”。那可是一份有着250年历史的文献。

大学用来抓作弊的这些工具,实际准确率到底有多高?相比检测器偶尔出错本身,更严重的问题在于把这种随时可能出错的工具给出的分数当成了确凿的证据。

🔍 大学为何依赖检测工具

随着 ChatGPT 等生成式 AI 的问世,代写文章的成本实际上已趋近于零。在西悉尼大学负责学术诚信事务的 Cath Ellis(音译)将其称为“规模上的根本变化”。过去虽然也有代写,但如今“至少有相当一部分被操纵或捏造的产出,其涌入的数量本身就暴增了”。

问题在于,现有的武器并不奏效。像 Turnitin 这类查重工具,是通过将语句与海量既有出版物进行比对,找出“抄袭痕迹”。然而,生成式 AI 写出的句子并不是从哪里原封不动抄来的,而是即时重新组合而成。没有可供比对的原文,自然就躲过了查重检测。AI 虽是通过学习以往的海量文本来生成句子,但产出的结果与所学习的原作在语句层面上并不完全一致。因此,靠比对既有文章的查重工具根本查不出来。

于是,声称能甄别“这篇文章是由其他 AI 所写”的检测工具应运而生。市面上已经涌现出 Copyleaks、GPTZero、ZeroGPT,以及 Grammarly、QuillBot 和 Turnitin 等开发的工具。面对铺天盖地的作业和申请材料,大学与研究生院开始依赖这些工具。

为什么“写得好的文章”会被判定为 AI

许多检测工具都依赖困惑度1这一指标。通俗地说,这是一个衡量“下一个词有多容易被预测”的数值。AI 撰写的文章往往在统计上遵循流畅且可预测的模式。因此,困惑度越低(即可预测性越高)的文字,就越容易被怀疑是“机器写的”;而出人意料的用词表达越多,就越会被判定为“人类写的”。

你看出问题所在了吗?按照这种逻辑,语法越严谨规范、文字越洗练流畅的人,反而越容易被怀疑使用了 AI。耶格尔所说的“我研读过语法书,写作时严格遵守规则,我想这正是我被误判为使用 AI 的原因”,指的正是这一点。仅仅因为写得好,反倒被揪了出来。

更严重的问题出现在非英语母语者身上。2023 年,斯坦福大学的一个研究团队测试了 7 款检测工具,将 91 篇在 ChatGPT 问世之前(2020 年之前)撰写的托福作文输入了进去。

在这 91 篇文章中,平均有 61.3% 被错误地分类为“由 AI 撰写”。 与之相对,由美国八年级(13~14 岁)学生撰写的英语作文,则几乎全部被准确地判定为“人类所写”。

非母语者的文字在表达的多样性上相对较低,因而困惑度偏低,检测工具却误以为这就是“像 AI”。误报率2达到 61%,意味着在这组全部由真人撰写的作文样本中,超过一半的文章被误判为了 AI 写作。这一数值来自 91 篇托福作文这一有限样本得出的结果。

《独立宣言》之所以中招也是出于同样的原理。历经 250 年被无数次引用和锤炼的句子,在统计上是高度“可预测”的。《自然》(Nature)期刊曾亲自将 1776 年原文的一部分多次输入 ZeroGPT,结果每次都被判定为 95%~100% 由 AI 撰写。

这种误判绝非偶发的意外。2025 年的一项研究对使用最广泛的 GPTZero 进行了验证,发现它虽然能以很高的置信度揪出成熟的 AI 文本,但将人类撰写的文章误判为 AI 的比例约为 16%。 研究人员的结论是:“在识别由人类撰写的文本方面,其可靠性是有限的。”

⚡ 即使出现更精确的检测工具,依然存在的问题

当然,并非所有检测工具都表现得如此不堪。纽约的 Pangram Labs 声称其误报率“几乎为零”。他们的切入路径截然不同:通过大量学习人类撰写的文章以及由 AI 重写后的版本,每当有新聊天机器人问世,系统就会去熟悉其文风。他们并不单单依赖困惑度这一项指标。在芝加哥大学布斯商学院与马里兰大学的独立评估中,其准确率也从未低于 99.8%。

但即使检测工具变得更精准,问题也并没有结束。

首先,是混合型文本。 研究 AI 对学术界影响的迈克·珀金斯(Mike Perkins,越南英国大学)表示:“检测工具能相当好地识别纯粹由 AI 生成的文章,但只要有人开始对文章修修补补,检测就会彻底崩溃。”甚至不需要人类亲自修改,只要让另一个 AI“帮我重写一下”,或者放进专门用来降低检测得分的“人性化润色工具(Humanizer)3”过一遍即可。检测公司一旦试图封堵这类绕过手段,新的绕过工具又会层出不穷。用珀金斯的话说,这是一场“对任何人都没有益处的庞大军备竞赛”。

其次,是一个更为根本的问题。 今年,马热娜·卡尔平斯卡(Marzena Karpinska)研究团队利用 Pangram 分析了 2025 年夏季美国 1,500 家报纸的 18.6 万篇报道,其中约 9% 被检测为部分或完全由 AI 撰写。然而卡尔平斯卡本人明确表示,虽然这一结果可用于观察“宏观趋势”,但绝不能作为判定个别作者有罪的依据。

“你不能以此为依据成批地给人定罪淘汰。”

同一个工具,即便能用于把握整体趋势,作为判定个人违规行为的依据也可能并不恰当。按群体维度计算出的比例,并不能证明特定某个人的文章就是用 AI 写的。

Oswarld视角

坦白说,我并没有把这件事仅仅看作一场关于“检测器性能”的争论。作为一个与数据打交道的人,首先映入我眼帘的是“阈值(threshold)”和“基础比率(base rate)”。

在做数据分析时,我经常遇到一个陷阱:即便是准确率高达 99.9% 的模型,如果目标群体足够大且“真正例”极为罕见,它依然会制造出相当多的冤枉者。

举个例子,假设有一款误报率仅为 0.1% 的极其出色的检测器。如果将其应用于 1 万名诚实亲笔写作的学生,其中大约会有 10 个人在没有任何过错的情况下被贴上“AI 作弊者”的标签。对这 10 个人来说,99.9% 的准确率根本起不到任何安慰作用。

珀金斯指出的要害也正是这个脉络。人们一旦看到分数,往往就会盲目相信。在查重时代,我们还有“这里的这句话与那篇论文一模一样”这样肉眼可见的证据。但在 AI 检测得分中,却根本没有这种证据。“87% AI”这个数字究竟是依据什么得出来的,无论是学生还是教授都无法验证。在制定 GTM(走向市场)策略的过程中,我曾多次目睹“包装成数字的确定感”是多么容易误导一个组织。分数本应是辅助判断的工具,却常常直接取代了判断本身。

因此,我的结论是这样的:检测器可以作为“调查的线索”,但一旦将其作为“定罪的证据”,像贾格尔这样严格恪守语法写作的人以及非母语者,就会最先沦为误判的牺牲品。这并不是说要彻底弃用这些工具,而是要把检测器给出的分数当作参考资料,而不是一锤定音的定论。

结语

第一,许多 AI 检测器会将严格遵循语法的文章和非母语者的文字误判为 AI 生成。斯坦福大学的研究显示,91 篇托福作文中有平均 61.3% 被错误归类为 AI 写作。 第二,即使出现更准确的检测器,面对经人工修改的混合文本或经过拟人化工具(Humanizer)处理的文章,也很难准确识别。而且,把握整个群体的宏观倾向与判定个人的作弊行为完全是两码事。 第三,真正危险的不是工具会犯错,而是把可能出错的评分当成确凿证据去坚信的态度。

如果您正处于评估文章或提交文字的位置,请务必记住一件事:AI 检测评分只能作为进一步核查的契机,绝不能直接作为盖棺定论的依据。

贾格尔为了通过审核,不得不故意将自己的文章改得“不那么完美”。为了躲避检测器而亲手把文字改差——您是否也曾经历过自己的文章、抑或学生或同事的作品被冤枉打上 AI 标签的情况?当时究竟发生了什么?欢迎在评论区留言分享,我们会在下一期内容中予以参考。


💬 如果您曾经历过被冤枉打上 AI 标签的情况,欢迎在评论区留言分享。我们会在下一期中参考采纳。

📨 如果觉得本文对身边的写作同僚有所帮助,欢迎转发分享。


参考资料与延伸阅读

核心来源

背景知识

  • Pangram Labs第三方评估合集,“Pangram评估”、“Chicago Booth Review”。:如果想了解“近乎为零的误报率”是如何得到验证的,请参阅此处。

原文

安光涉(Oswarld)个人插画

作者 安光涉(Oswarld) 现任世宗大学兼任教授,INLEVEL9 战略顾问。职业经历、研究、著作与近期活动会持续更新在作者简介。 最新动态 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

注释

  1. 困惑度(perplexity):衡量下一个词语可预测程度的数值。数值越低,说明句子越“合乎套路”,被判定为AI生成的概率越高;数值越高,越被视作人类所写。

  2. 误报率(false positive rate):实际上是人类所写,却被错误判定为“由AI生成”的比例。可以理解为无辜者被错怪的概率。

  3. 拟人化改写器(humanizer):将AI撰写的文本修改得更像人类笔触,从而降低检测分数的工具。