第 277 期

让人工智能写出“像人一样”的文字的方法

这不是让人从一开始就自己写就行了吗?

商业让人工智能写出“像人一样”的文字的方法

消除AI腔调的工具正在集中出现

最近映入眼帘的四份资料,全都指向同一个方向。

Hugging Face 上出现了一个打着“像人一样写作的AI”旗号的模型,叫做 Hemmingway-1。在 GitHub 上,一个号称能消除AI所写韩文中痕迹的 Claude 技能 im-not-ai,截至9月22日星期数已超过5,600颗。在前端领域,有人在使用 Taste Skill,用来阻止AI编码工具输出那些千篇一律的界面。在 Facebook 上,则流传着一篇文章,讲的是把为航空器维修文档制定的英文规范,改写成用于韩文报告的提示词。

它们下手的地方各不相同。有的是重新训练模型,有的是修改已经写好的文字,也有的是在动笔之前就设好规则。但期望得到的结果都很相似:让AI写出来的东西看不出破绽。

不过看着这份清单,脑子里先冒出来的是一个问题。如果需要的是“像人写的”文字,那不是让人从一开始就自己写就行了吗?今天我就来拆解一下,这些工具各自把“像人一样”定义成了什么,借此回答这个问题。

三处同时下手

重新训练模型的Hemmingway-1

Hemmingway-1是在Qwen3.8-27B基础上追加训练1而成的 270 亿参数2模型。开发方公开了权重,且采用Apache-2.0许可,因此也可以用于商业用途。

这个模型瞄准的问题相当具体。开发方举了一个例子:请求模型代写一条告知房东锅炉故障的短信。一般模型会给出三个候选短信,再附上问候语和每个候选的说明,而Hemmingway-1只给出短信本身。据开发方自行测得的数据,Fable 5、GLM-5.3、Kimi K3十次中有九次以上都把实际会发送的句子埋在了说明和选项之中。

“像人写的”这一说法,也拿出了数字来支撑。他们把针对 80 个真实请求的答案与其他模型的答案两两配对,在遮住来源的情况下进行比较。在被判定为人类所写的比例上,Hemmingway-1比排名第二的模型高出26个百分点。在难以下笔的请求文字上,GPT-6 Astra是9%,Hemmingway-1是72%。

不过要连同条件一起看。这套评测集是开发方自己制作并运行的,判定也不是由人来做,而是由另一个AI模型来做。开发方自己也先说明了这一点。此外还附有警告:这是一款以英语为中心的模型,即便说错也可能用自信满满的语气讲出来,所以不要用于医疗、法律、金融判断。

修改成稿的im-not-ai

im-not-ai是一款专注于韩语的润色工具。可以作为技能3安装到Claude Code这类编程代理中使用。它把AI写出的韩文里残留的痕迹分成10个大类、70个细分模式,标出严重程度后找出并修改。“通过~”、“在~方面”这类翻译腔4,“综上所述”、“具有重大启示意义”这类套话,以及机械式的“第一、第二、第三”罗列,是它主要针对的对象。

值得关注的是它自己设定的底线。事实、主张、数值、专有名词、直接引用都不会被触碰。相对原文的改动率超过30%就会发出警告,超过50%就会停止作业。像“不是A而是B”这类对偶结构如果被全部打破,以致连作者的声音都被抹去,那也会被判定为失败。它的设计目标是只修改语气,不动内容。

在动笔前就设下规则的ASD-STE100与Taste Skill

ASD-STE100是1986年首次问世的受控语言5规范。由欧洲航空航天业界接受各航空公司的要求而制定。因为如果母语非英语的维修人员读错手册,可能会造成人员伤亡,所以直接把语言本身收窄了。现行版本是2025年1月发布的第9版,从这一版开始,名称由“规范”改为了“国际标准”。它由53条写作规则和约900个核准词汇组成,每个词只允许一个含义、一种词性。名词连用不超过三个,可使用的动词形式也限定在几种之内。

我也在借用这套规范。在为Notion韩语用户制作的INLEVEL9 Skills中,我在制定文档写作规则时参考了ASD-STE100的思路。长期使用Notion的经历让我体会到,在动笔之前先定好词汇、句子和文档结构的规则,效果更好。无论是自己动手写,还是交给Notion AI来写,只要标准明确,结果就更一致,也更容易审校。

于是我设定:一个区块只放一项内容,同一个概念用同样的说法表达,并把已确定的决定、建议、以及尚未确定的事项区分开来。还让它在最后检查一遍,确认已核实的事实与作者的解读是否混在了一起。此外还加入了一条规则:像负责人、期限、完成状态这类资料中没有的值,不要靠猜测填上,而应留为未定。

Taste Skill把同样的思路应用在了界面设计上。它把规则和禁止清单打包成技能文件,防止AI编程代理生成千篇一律的模板化界面,并要求在导出结果之前先通过一份检查清单。它自称是一套“反Slop”6框架。

衡量“像人类”的标尺在摇晃

观察这四款工具如何衡量“人味儿”,会发现一个共同点。由于无法直接衡量人味儿,它们反过来用“没有AI痕迹的状态”来定义人味儿。

Hemmingway-1的“像人类”,指的是判定模型误判为人类写作的比例。im-not-ai的标准,则是AI文章中常见模式的清单。这种方式的弱点,在im-not-ai接受外部验证时暴露了出来。

数据质量企业Pebblous在8月拆解了im-not-ai的公开代码,发现一篇写于ChatGPT问世之前、2020年由人类撰写的散文,被判定为最高风险等级。原因出在作者的逗号使用习惯上。该作者在连接语尾后使用逗号的比例高达83.3%,仅这一项指标就左右了整体判定。开发团队用532篇人类撰写的文章重新测试后发现,其中285篇(53.6%)被判定为AI高风险。

开发团队的应对速度很快。他们为单一系列指标的影响设了上限,改为要求两个不同系列同时命中才判定为高风险,并为专栏和报告这两种文体分别建立了基准线。之后用同样的532篇文章测试,高风险判定降为0篇。开发团队也在README中坦承了局限:这是用建立基准线所用的文章重新测试的结果,能否适用于新文章尚不清楚。公开反例并加以改进的过程,反而让人更信任这个项目。

不过,这起事件揭示的事实依然成立:被归类为AI痕迹的习惯,很大一部分原本就是人类的习惯。正如第213期所述,聊天机器人的语气,是从人们郑重其事撰写的公司报告和论文中学来的。而且,指纹一直在搬家。曾经是AI文章标志的词汇,在最新模型中几乎已经消失,被其他表达取而代之。今天的痕迹清单,更接近于特定时期模型们的习惯清单。

由此产生一个担忧。如果同一款技能被数千人安装,那些绕开禁用清单的句子,可能会彼此变得相似。旨在阻挡陈词滥调的规则一旦广泛流传,遵循这套规则的文字本身,也可能成为下一代的陈词滥调。用禁用清单定义出的人味儿,是一个必须不断追赶的靶子。

人们想要的不是“像人”,而是少费些力气的文章

这次我们来看看这些工具实际修改的对象是什么。Hemmingway-1 修改的是埋藏在解说里的文字,im-not-ai 修改的是翻译腔和难读的句子,ASD-STE100 修改的是可能被误读的指示,Taste Skill 修改的是似曾相识的界面。没有一个工具是在追究“谁写的”。它们全都是在减少读者要付出的辛苦。

humanlike writing ai在这一点上,ASD-STE100 稍微有些不同。它不是为了让文字看起来像人写的而制定的规格。它是为了防止人写的说明书被人误读而制定的。它把好文章的标准,不放在要模仿的作者身上,而放在可能因误读而受伤的读者身上。以读者为基准来立规则,那么“AI 味”的相当一部分,即便不特意针对它,也会一并被剔除。

因此,“像人一样”是一个有点不准确的要求。人们用这句话所想要的,大都是读者不会看得云里雾里的文章。

那么,人应该从一开始就自己写吗

回到小标题提出的问题。把四款工具的说明书并排放在一起看,会发现它们都在同一个位置留白。

im-not-ai把不改动内容一个字的原则放在了最前面。Hemmingway-1自己也提醒使用者,它可能会自信满满地说出错误的话。前面提到的我的Notion规则里那条未定条款也是一样。这是一条只有在有人去确认资料是否有价值时才能生效的规则。

要主张什么、确认了什么、要负责到什么程度,任何工具都不会替你填上。工具们处理的只是承载那些既定内容的表面。所以这个问题的答案只能算一半的“是”。句子可以交给工具。但主张,必须由人从一开始就自己写。

如果把顺序颠倒过来,就会出问题。在没有任何人做过判断的初稿上,只是抹去AI的痕迹,写出来的东西会很流畅,但里面空无一人。到目前为止,生硬的翻译腔或平淡无奇的结论,一直在向读者发出“这篇文章可能没有被认真核实过”的信号。而润色工具,会把这个信号也一并抹去。第195号中谈到的检测器误判,是人写的文章被误判为AI写的问题。这一次正相反:没有被人确认过的文章,反倒看起来像是人写的。

Oswarld视角

我常说,并不是所有工作都需要最聪明的模型。Hemmingway-1就是这句话的一个好例子。据说这个 270 亿参数的模型,在日常消息这种范围狭窄的任务上,胜过了规模大得多的模型。 即便考虑到这是开发公司自身的评测,我认为这个方向本身是对的——它展示了把任务范围定得很窄的模型能在哪些地方获胜。

不过,我很难认同以“像人写的文字”为目标的设计。这个目标是以“AI 味”为基准来定义的,而“AI 味”会随着模型的更新而不断迁移。基准一旦动摇,最终就会演变成检测器和润色器互相追逐的游戏。如果是我,会把靶心定在读者身上:谁会读这段文字、读完之后要做什么、在哪里可能被误读。我认为ASD-STE100之所以能历经40年、不断修订版本却依然屹立不倒,正是因为它把基准放在了那里。INLEVEL9 Skills参考这一规格的理由也是一样。我想要的从来不是看起来像人写的文档,而是更清晰的文档和一致的工作。

所以,对于“那干脆让人来写不就行了吗”这个问题,我想这样回答:人从一开始就必须承担的是判断。带有判断的初稿,工具越打磨就越好;而没有判断的初稿,越打磨,那个空缺反而越不容易被看见。

结语

这次介绍的这些工具,在抹去AI写作痕迹这件事上已经变得相当精巧。也正因如此,文章中残留的痕迹曾经给读者的警示信号,也在随之减弱。今后判断一篇文章是否可信的线索,将更多地留存在它主张了什么、又以什么作为依据,而不是它的文风上。


💬 读者在AI写的文章中,读到哪些地方时会停下来?是语气,还是内容?欢迎在评论区告诉我们。

📨 如果身边有同事在用AI起草报告或消息,欢迎把这篇文章分享给他们。这会是一个可以聊聊“哪些交给AI、哪些自己动手写”的话题。


你的观点会成为下一期的线索

欢迎留下你的经验与看法。

注册读者均可免费发表评论。

参考资料与延伸阅读

安光涉(Oswarld)个人插画

作者 安光涉(Oswarld) 现任世宗大学兼任教授,INLEVEL9 战略顾问。职业经历、研究、著作与近期活动会持续更新在作者简介。 最新动态 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI。

📝 术语说明

注释

  1. 追加训练(微调):让已经完成训练的模型再学习特定用途的数据,从而按想要的方向调整其行为。 ↩

  2. 参数:模型在学习过程中调整的内部数值。数量越多,模型通常就越大,运行所需的运算量也越大。 ↩

  3. 技能:AI智能体在执行特定任务时读取的一套指令和脚本。通常以一个名为SKILL.md的文件为核心构成。 ↩

  4. 翻译腔:把外语,尤其是英语的句子结构原样搬到韩语里,读起来显得生硬别扭的表达方式。 ↩