第284号

供給網を壊す製品だと、作った側が先に書いていました

マイクロソフト・OpenAIの内部文書が法廷で明らかになりました

ビジネス供給網を壊す製品だと、作った側が先に書いていました

「史上最大の労働窃盗」より長く残る一文

先月17日(現地時間)、ニューヨーク・タイムズがOpenAIとマイクロソフトを相手に起こした著作権訴訟で、封印されていた文書の一部が公開されました。記事の見出しは、ほとんど同じ一文を掲げていました。マイクロソフトの応用科学ディレクター、ブレント・ヘクトが2023年1月の内部メモに記したとされる表現、「人類史上最大の労働窃盗」です。

見出しになりそうな一文です。ただ、私は同じ人物が書いた別の一文のほうで、より長く立ち止まりました。大規模言語モデル(LLM)は自らの供給網を破壊する製品だという一文です。マイクロソフトの内部文書には、こんな趣旨の記述もあったといいます。最終製品が主要な供給者の経済的基盤を脅かすのは極めて稀なことだが、私たちはLLM事業でまさにその状況を作り出した、と。

窃盗は倫理の言葉であり、法廷で争われる単語です。供給網は事業の言葉です。今日は後者の話をしてみようと思います。社内で何を知っていたのか、何を数字で確認していたのか、それを知りながらなぜ供給者をつなぎ止める方向に動かなかったのか、についてです。

公開された文書に書かれていたこと

まず何が出てきたのかを整理します。訴訟は2023年12月にニューヨーク・タイムズが提起し、現在はニューヨーク・デイリーニューズを含む他11社のメディアが加わっています。ニューヨーク州南部連邦地裁のシドニー・スタイン判事が略式判決1の申立てを審査しており、その過程で文書が少しずつ明らかになっています。

今回公開された部分は、大きく三つに分かれます。

一つ目は規模です。原告側の書面によると、OpenAIの中間学習データセットだけで原告メディアの記事コピーが9万1,692件を超えて含まれており、コモンクロール2から抽出したあるデータセットには、nytimes.comの文書だけで200万件を超えていました。ペイウォールを回避し、学習データから著作権表示を削除したという状況も原告側の主張に含まれています。OpenAIの研究者がニューヨーク・タイムズのペイウォールを回避する「ハック」を報告したところ、グレッグ・ブロックマン社長が「ああ、いいね」と答えたというやり取りも、そのうちの一つです。

二つ目は社内の懸念です。ヘクトのメモ以外にもあります。ChatGPTの開発を率いたニック・ターリーは2023年6月のメモで、AIはメディアにとって存在論的な脅威だと書き、2024年2月には、AI製品が良くなるほどますます代替的になるだろうと記しました。2020年には、当時OpenAIの政策ディレクターだったジャック・クラークが、サム・アルトマンとブロックマンに宛てて、会社は社会の文化を作る人々の労働を代替するシステムを作ることになるだろうというメモを送りました。クラークはその後会社を離れ、Anthropicを共同創業しました。

三つ目は経営陣の証言です。サティア・ナデラ マイクロソフトCEOは証言録取で、ペイウォールの向こうのコンテンツを使おうとする者は誰であれライセンスを取得すべきだと述べました。そして、OpenAIがペイウォールの向こうの情報をスクレイピングして学習させたと知っていたなら、モデルの再学習を求める権利を行使していただろうとも語りました。

ただし、読む際に注意すべき点が二つあります。今回出てきた内容の多くは、原本の証拠ではなくニューヨーク・タイムズ側の書面に引用された抜粋です。原文書はまだ封印されているため、前後の文脈のない切り取られた文章だという意味です。そしてマイクロソフトは、ヘクトのメモが会社の立場ではないと反論しました。法廷提出書面では、彼は意思決定権者ではなく、別の角度からの視点を出すために雇われた研究者だったと説明しています。OpenAIはコメント要請に応じませんでした。

「窃盗」より重い言葉は「代替」です

見出しは窃盗でしたが、裁判で重みを持つ言葉は別にあると見ています。代替です。

OpenAIとMicrosoftの防御ロジックは、米国著作権法のフェアユース3です。記事を学習に使ったのは原文を新たな何かへと十分に変形したものであり、原文の市場価値を損なう代替物ではないという主張です。フェアユースを判断する際に裁判所が検討する要素のひとつが、その利用が原著作物の市場にどのような影響を与えるかです。

ところが今回の文書には、社内で使われた「代替」という単語が繰り返し出てきます。ターリーはAI製品はおおむね代替的だと書き、そこに「以上、終わり」と付け加えています。2023年2月、OpenAIのあるエンジニアは、リンクをどれだけ目立たせても、ユーザーはクリックしないだろうと同僚たちに書いています。Microsoft自身のデータでは、Copilotの回答エンジンが従来のBing検索に比べてnytimes.comのクリック率を最大93%まで落としたという一節も、書面に含まれています。

このリンクをめぐる話は、私たちのニュースレターでも何度か取り上げてきました。Googleがパブリッシャーに優先ソースボタンを差し出したときも、AI要約が付くとリンククリックがほぼ半分に減るという外部調査を引用していました。今回変わったのは出典です。外部の調査機関ではなく、製品を作った会社自身の内部データとエンジニアの文章だという点です。「出典リンクを付ければトラフィックが戻る」という説明を、作った側自身がまず信じていなかったわけです。

Googleの優先ソースボタン、フォロワー数は教えてくれません・第210号・INLEVEL9Googleが公開した優先ソース埋め込みボタンの内容と、パブリッシャーが自サイトを指定した読者数や流入量を確認できない理由をまとめましたinlevel9.com

だからといって、訴訟の結果をここで予断することはできません。これまで米国の裁判所は、AI学習をフェアユースと見なす方向におおむね傾いてきましたし、今月初めにはトランプ政権がOpenAI側を支持する意見書を提出しています。文脈を欠いた抜粋は、裁判の場でいくらでも違った読み方をされ得ます。ただ、「変形であって代替ではない」と主張する会社の内部から「代替だ、終わり」という一文が出てきたという事実は、判決とは別に記録として残りました。

サプライヤーを干上がらせる購入者

さて、サプライチェーンの話に戻ります。

事業をしている立場からすると、中核的なサプライヤーが崩れるのは倫理の問題である以前に生存の問題です。昨年8月にSanDiskについて書いたときは、ちょうど正反対の場面でした。AIデータセンターを建設する顧客たちがNAND供給会社と4年を超える契約を結び、契約を破棄すればすぐさま資金が渡るよう165億ドル規模の保証まで設定しました。部品が途絶えれば自社の事業が止まってしまうので、購入者の側が先回りしてサプライヤーの生存に資金を投じたわけです。

SanDiskの4年契約、165億ドルの保証まで・第183号・INLEVEL9顧客8社が4年以上の供給契約と165億ドルの財務保証を先に要求しましたinlevel9.com

ヘクトの文書が興味深いのは、この論理をそのままコンテンツに当てはめている点です。彼はCopilotがメディアのクリックを減らす現象を「破滅のループ」と呼びました。メディアが弱れば良い記事が減り、良い記事が減ればモデルの性能も落ち、ウェブ全体がともに悪化していくというわけです。倫理的な訴えというより、自社製品の原材料調達に対する警告でした。

ですが半導体とは違い、コンテンツの世界では購入者がサプライヤーを引き留めませんでした。なぜそうなったのか、文書自体は直接答えていません。ここから先は私の解釈ですが、二つの要因が重なったのだと見ています。

一つは時差です。NANDは今日途絶えれば今日サーバーが止まります。一方、記事はすでに数十年分が学習済みなので、サプライヤーが崩れるコストは何年か後になってようやく請求されます。もう一つはサプライヤーの数です。NAND供給会社は指折り数えるほどしかありませんが、記事を書くところは数え切れないほどあります。一箇所が崩れても、当面は代替先があるように見えてしまうのです。この二つの条件が重なると、サプライチェーンが崩れつつあると分かっていても、今日お金を払う理由は弱まってしまいます。

その間にサプライヤー側の値段は、訴訟と個別契約によって定められ始めました。News Corpのようにオープン AI と大型契約を結んだメディアもあれば、私のように本一冊をAI学習用にライセンスして数百ドルを受け取った著者もいます。ただしこれは、サプライチェーンを設計した結果というより、崩れていくのを見ながら急いで継ぎ当てた断片に近いものです。

Oswarldの視点

今回の文書で私が一番長く目を留めたのは別の箇所です。Microsoftがヘクトについて語った説明のことです。違う視点を出すために雇われた人であり、意思決定権者ではなかったという説明です。

supply chain防御の論理としては筋が通っています。ですが組織設計として読むと妙です。反対意見を出すために人を採用し、その人がまさにその仕事をこなしたのに、いまになってその結果は会社の立場ではなかったと言っているわけです。警告はあった、しかし決定する場まで届かなかったという告白としても読めます。ナデラの証言も同じ形をしています。知っていれば再学習を要求しただろうという言葉は、裏を返せば知り得たはずの情報が自分の机まで届かなかったという意味だからです。もちろん証言は証言であり、自らを守るための言葉かもしれません。

クラークの2020年のメモまで並べてみると、絵柄はさらにはっきりします。警告は一度きりではなく、一つの会社だけにあったわけでもありません。2020年、2023年、2024年にわたって、二つの会社の中で同じ方向の文章が何度も書かれていました。それでも方向は変わりませんでした。

最近AIを導入する企業がよく作るポストがあります。倫理委員会、レッドチーム、責任あるAI担当といった役職です。私はこうしたポストが必要だと思っています。ただ今回の事例が示しているのは、反対意見を出す場を作ることと、その意見が決定に届く経路を作ることはまったく別物だということです。経路がなければ、そのメモは何年か後に法廷で、しかも相手側の証拠として初めてまともに読まれることになります。

だから私は、組織にまずこう問いかけるほうがいいと思っています。「これは我々のサプライチェーンを壊す」というメモが上がってきたとき、そのメモは誰の机で止まるのか、と。

おわりに

今回の文書が判決を決めるわけではありません。抜粋は文脈を欠いていますし、裁判所は依然としてフェアユース寄りの姿勢を崩していません。ただ、AI企業の内部で使われていた言葉のほうが、外部からの批判よりも問題を正確に言い当てていたという事実は残ります。「窃盗」という言葉よりも、「サプライチェーン」という言葉が。


💬 読者さんの組織には、内部の反対意見が決定の場まで届く経路がありますか。その経路をたどって方向が実際に変わった経験、あるいは最後まで届かなかった経験があれば、コメントで聞かせてください。

📨 AI導入やコンテンツ事業について悩んでいる同僚がいたら、この記事を転送してください。

あなたの視点が次の号をつくります

この号で最も共感した点、あるいは違う経験をした点はどこですか。

読者アカウントがあれば無料でコメントできます。

参考資料と関連リンク

主要出典

併せて読みたい過去号


アン・グァンソプ(Oswarld)のイラスト

著者 アン・グァンソプ(Oswarld) は世宗大学校 兼任教授、INLEVEL9 戦略コンサルタントです。経歴、研究、著書、最近の活動は著者紹介で更新しています。 最近の活動 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI。

📝 用語解説

각주

  1. 略式判決(summary judgment):事実関係に実質的な争いがないと見なされる場合、正式な裁判(陪審審理)まで進まずに、裁判官が法律問題のみで判断を下す手続きです。双方がこの段階で自分に有利な証拠を積極的に提出するため、封印されていた文書がこのときに明るみに出るケースが少なくありません。 ↩

  2. Common Crawl:ウェブページを大規模に収集し、無料で公開している非営利のアーカイブです。多くのAI研究所が学習データの出発点として使っています。 ↩

  3. フェアユース(fair use):米国著作権法において、批評・報道・パロディなど一定の場合に許諾なしで著作物を利用できるようにする原則です。利用の目的と性格、原著作物の性格、利用した分量、原著作物の市場に与える影響という4つの要素を併せて検討します。 ↩