第277号

「人間らしく」文章を書くAIをつくる方法

そもそも人間が最初から書けばいいのではないでしょうか?

ビジネス「人間らしく」文章を書くAIをつくる方法

AIの口調を消すツールが一斉に出てきています

最近目に留まった資料四つが、全部同じ方向を指していました。

Hugging Faceには「人間のように書くAI」を掲げたHemmingway-1というモデルが上がっていました。GitHubでは、AIが書いた韓国語の文章からその痕跡を消してくれるというClaudeスキルim-not-aiが、9月22日時点でスター5,600個を超えています。フロントエンドの領域では、AIコーディングツールが吐き出す紋切り型の画面を防ぐというTaste Skillが使われていますし、Facebookでは、航空機整備文書向けに作られた英語規格を、韓国語レポート用のプロンプトに書き換えたという投稿が出回っていました。

手を入れる場所はそれぞれ違います。モデルを再訓練することもあれば、書き終えた文章を直すこともあり、書く前にルールを課すこともあります。しかし望む結果は似ています。AIが書いたと気づかれない文章です。

ただ、このリストを眺めていると、まず一つの疑問が浮かびます。人間が書いたような文章が必要なら、そもそも人間が最初から書けばいいのではないでしょうか。今回は、これらのツールがそれぞれ「人間らしさ」を何と定義しているのかを解きほぐしながら、この疑問に答えてみます。

三箇所で同時に手を加えています

モデルを再教育したHemmingway-1

Hemmingway-1は、Qwen3.8-27Bをベースに追加訓練した1270億パラメーター2のモデルです。重みを公開しており、Apache-2.0ライセンスなので商用にも利用できます。

このモデルが狙う課題はかなり具体的です。開発元は、大家にボイラーの故障を知らせるメッセージの作成を頼む場面を例に挙げています。通常のモデルはメッセージ候補を3つ出し、挨拶文や候補ごとの解説まで付けてくるのに対し、Hemmingway-1はメッセージだけを返すというわけです。開発元が独自に測定した数値によると、Fable 5、GLM-5.3、Kimi K3は10回中9回以上、実際に送る文章を説明や選択肢の中に埋もれさせてしまったそうです。

「人間らしい」という主張も数値で裏付けています。実際のリクエスト80件について、他モデルの回答とペアにし、誰が書いたかを伏せたうえで比較しました。人間が書いた文章と判定された割合で、次点のモデルを26ポイント上回ったといいます。書きにくい依頼文では、GPT-6 Astraが9%、Hemmingway-1が72%でした。

ただし、条件も併せて読む必要があります。この評価セットは開発元自らが作成・実行したもので、判定も人間ではなく別のAIモデルが行いました。開発元自身もこの点をあらかじめ明らかにしています。英語中心のモデルであること、間違っていても確信に満ちた口調で話すことがあるため、医療・法律・金融の判断には使わないようにという警告も付いています。

書き終えた文章を直すim-not-ai

im-not-aiは、韓国語に特化した文章校正ツールです。Claude Codeのようなコーディングエージェントにスキル3としてインストールして使います。AIが書いた韓国語に残る「らしさ」を10の大分類、70の細分パターンに分け、深刻度を付けて検出したうえで修正します。「〜を通じて」「〜において」といった翻訳調4、「結論的に」や「示唆するところが大きい」といった慣用句、機械的な「第一に・第二に・第三に」の羅列が代表的な対象です。

注目すべきは自ら定めた禁止線です。事実・主張・数値・固有名詞・直接引用には手を付けません。原文に対する変更率が30%を超えると警告し、50%を超えると作業を停止します。「AではなくB」のような対句をことごとく崩し、書き手の声まで消してしまう場合も失敗として扱います。文体だけを直し、内容には手を加えないという設計です。

書く前にルールを課すASD-STE100とTaste Skill

ASD-STE100は、1986年に初めて登場した統制言語5規格です。欧州の航空宇宙業界が、各航空会社の要請を受けて策定しました。英語を母語としない整備士がマニュアルを読み誤ると人が怪我をしかねないため、言語そのものを狭めたわけです。現行版は2025年1月に出た第9版で、この版から仕様書ではなく国際標準へと名称を変えました。作成ルール53項目と承認語彙約900語で構成されており、単語ごとに意味と品詞を1つだけ許容します。名詞を4つ以上連結せず、使える動詞の形もいくつかに制限します。

私もこの規格を取り入れて使っています。Notion韓国語ユーザー向けに作ったINLEVEL9 Skillsで文書作成ルールを組む際、ASD-STE100のアプローチを参考にしました。Notionを長く使ってきて、文章を書く前に語彙と文と文書構造のルールを先に決めておくほうが効果的だと実感してきたからです。自分で書くときも、Notion AIに作成を任せるときも、基準が明確であれば結果がより一貫し、レビューしやすくなりました。

そこで、1つのブロックには1つの内容だけを入れ、同じ概念には同じ言葉を使い、確定した決定事項と提案、まだ決まっていない事柄を区別するようにしました。確認済みの事実と作成者の解釈が混ざっていないかも最後にチェックさせています。担当者、期限、完了状況のように資料にない値は推測で埋めず、未定のままにしておくというルールも入れました。

Taste Skillは、同じ発想を画面デザインに適用しています。AIコーディングエージェントがテンプレートのような画面を作らないよう、ルールと禁止リストをスキルファイルにまとめ、成果物を出力する前にチェックリストを通過させます。自らを「アンチスロップ」6フレームワークと呼んでいます。

「人間らしい」を測る物差しが揺れています

4つのツールが人間らしさをどう測っているかを見ると、共通点があります。人間らしさを直接測れないので、AIらしさがない状態として逆から定義しているんです。

Hemmingway-1の「人間らしい」は、判定モデルが人間の文章だと誤認した比率です。im-not-aiの基準は、AIの文章によく出るパターンのリストです。このやり方の弱点は、im-not-aiが外部検証を受ける過程で明らかになりました。

データ品質企業のPebblousが8月にim-not-aiの公開コードを分析したところ、ChatGPTが登場する前の2020年に人間が書いたエッセイが最高リスク等級と判定されました。原因は書き手の句読点の癖でした。接続語尾の後にカンマを打つ比率が83.3%あり、この一つの指標が判定全体を左右していたのです。開発チームが人間の文章532編で改めて測定したところ、285編、つまり53.6%がAI高リスクと判定されました。

開発チームの対応は早いものでした。ある系統の指標が与える影響に上限を設け、異なる2つの系統に同時に引っかかった場合のみ高リスクと見なすように変更し、コラムやレポートといったジャンルには別の基準線を用意しました。その後、同じ532編での高リスク判定は0編になりました。基準線を作るのに使った文章で改めて測定した結果なので、新しい文章でも通用するかはまだわからないという限界もREADMEに記しています。反例を公開して修正していく過程こそ、このプロジェクトを信頼できるものにしていると言えます。

それでも、この一件が示した事実は残ります。AIの兆候として分類されてきた習慣の少なからぬ部分は、もともと人間の習慣だということです。第213号で取り上げたように、チャットボットの話し方は、人間が格式を整えて書いた会社の報告書や論文から学んだものです。そして指紋は絶えず移り変わっていきます。かつてAIの文章の象徴だった単語は最新モデルではほとんど姿を消し、別の表現がその座を埋めています。今日の兆候リストは、特定の時期のモデルたちの癖のリストに近いのです。

ここで一つ心配が生まれます。同じスキルを数千人がインストールすれば、禁止リストをかいくぐった文章同士が似通っていく可能性があります。ありきたりな文章を防ごうとするルールが広く普及すれば、そのルールに従った文章が次の世代のありきたりさになるかもしれません。禁止リストで定義された人間らしさは、追いかけ続けなければならない的なのです。

求めていたのは「人間」より手間のかからない文章でした

今度は、これらのツールが実際に直しているものを見てみましょう。Hemmingway-1は解説の中に埋もれた文字を、im-not-aiは翻訳調で読みにくい文を、ASD-STE100は誤読されかねない指示を、Taste Skillはどこかで見たような画面を直します。誰が書いたかを問うツールはひとつもありません。すべて、読む人が払う手間を減らす方向を向いています。

humanlike writing aiその点で、ASD-STE100は少し毛色が違います。人間らしく見せるために作られた規格ではありません。人間が書いたマニュアルを人間が誤読することを防ぐために作られました。良い文章の基準を、それを真似る書き手の側ではなく、誤読すれば怪我をしかねない読者の側に置いたのです。読む人を基準に規則を立てれば、AIらしさの多くはわざわざ狙わなくても一緒に消えていきます。

だから、「人間らしく」はいささか不正確な注文です。人々がこの言葉で本当に求めていたのは、たいてい読む人が迷わない文章でした。

では、人は最初から書くべきなのでしょうか

小見出しの問いに戻ってみます。四つのツールの説明書を並べて見ると、どれも同じ場所を空けたままにしています。

im-not-aiは内容を一字も変えないという原則を最前面に掲げています。Hemmingway-1は間違ったことを確信に満ちて言う可能性があると自ら警告しています。先ほど述べた私のNotionルールの未確定条項も同じです。資料に値があるかどうかを確認する人がいて初めて機能するルールなのです。

何を主張するか、何を確認したか、どこまで責任を負うかは、どのツールも埋めてはくれません。ツールが扱うのは、そうやって定まった内容を載せる表面にすぎません。だから問いへの答えは半分だけ「はい」です。文章は任せられます。主張は人が最初から書かなければなりません。

順序を逆にすると厄介なことになります。誰も判断していない草稿からAIっぽさだけを消せば、滑らかだけれど中に誰もいない文章ができあがります。これまでは、ぎこちない翻訳調やありきたりな結論が、読者に対して「この文章は誰もきちんと確認していないかもしれない」というシグナルの役目を果たしていました。推敲ツールは、そのシグナルまで一緒に消してしまいます。第195号で扱った検出器の誤検知は、人が書いた文章がAIの文章に誤って分類される問題でした。今回はその逆で、人が確認していない文章が、人が書いた文章のように見えてしまうのです。

Oswarldの視点

私は「あらゆる作業に最も賢いモデルが必要なわけではない」とよく言います。Hemmingway-1はその好例です。270億パラメータのモデルが、日常メッセージという狭いタスクにおいてはるかに大きなモデルたちを上回ったというのですから。 開発元による自己評価という条件を差し引いても、タスクを狭く定めたモデルがどこで勝てるのかを示す方向性としては正しいと思います。

ただし、「人間らしい文章」を目標に据える設計には同意しかねます。その目標は「AIっぽさ」を基準に定義され、「AIっぽさ」はモデルが変わるたびに引っ越してしまいます。基準が揺らげば、結局は検出器と推敲ツールが互いを追いかけっこする競争になります。私であれば、狙いを読む人に置きます。この文章を誰が読むのか、読んだ後に何をすべきか、どこで読み違える可能性があるのか、です。ASD-STE100が40年にわたり版を重ねながら生き残ってきたのも、基準をそこに置いていたからだと考えます。INLEVEL9 Skillsでこの規格を参考にした理由も同じでした。私が望んだのは人間らしく見える文書ではなく、より明確な文書と一貫した業務でした。

そこで**「それなら人間が書けばいいのでは」という問いには、こう答えたいと思います。人間が最初から書かなければならないのは「判断」です。判断のある草稿は道具が磨くほど良くなり、判断のない草稿は磨けば磨くほどその空白が見えなくなってしまいます。**

おわりに

今回見てきたツールは、AIが書いた痕跡を消す点でかなり精巧になっていました。それだけ、文章に残る痕跡が読者に与えていた警告も弱まりつつあります。その文章を信じるかどうかを判断する手がかりは、これからは文体よりも、その文章が何を主張し、何を根拠に挙げているかにより多く残ることになるでしょう。


💬 読者さんは、AIが書いた文章のどの部分に出会うと読むのをやめますか?それが話し方だったのか、内容だったのか、コメントで教えてください。

📨 AIでレポートやメッセージの下書きを書いている同僚がいたら、この記事をシェアしてください。何を任せて何を自分で書くか、話し合うきっかけになるはずです。


あなたの視点が次の号をつくります

この号で最も共感した点、あるいは違う経験をした点はどこですか。

読者アカウントがあれば無料でコメントできます。

参考資料と関連リンク

アン・グァンソプ(Oswarld)のイラスト

著者 アン・グァンソプ(Oswarld) は世宗大学校 兼任教授、INLEVEL9 戦略コンサルタントです。経歴、研究、著書、最近の活動は著者紹介で更新しています。 最近の活動 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI。

📝 用語解説

각주

  1. 追加学習(ファインチューニング):すでに学習を終えたモデルに、特定の用途向けのデータをさらに学習させ、望む方向に振る舞いを調整することです。 ↩

  2. パラメーター:モデルが学習しながら調整する内部の数値です。数が多いほど概してモデルは大きくなり、動かすのに必要な演算量も増えます。 ↩

  3. スキル:AIエージェントが特定の作業を行う際に読み込む、指示とスクリプトの束です。通常はSKILL.mdというファイルを中心に構成されます。 ↩

  4. 翻訳調:外国語、特に英語の文構造をそのまま移し替えたために、韓国語として不自然に読める表現のことです。 ↩