9月19日、Inside AIが「NYT Filings Reveal Microsoft, OpenAI Knew of 'Theft' Risks in AI Training」と題した記事を公開した。ニューヨーク・タイムズ対OpenAI・Microsoft訴訟で新たに封印解除(unsealed)された内部文書が、両社幹部がAI学習データの「盗用」リスクを事前に認識していたことを示している。とりわけ衝撃的なのは、Microsoftの社員がAI学習のためのコンテンツ大量収集を社内メモで「人類史上最大の労働搾取」と表現していた事実だ。この文書の存在は、両社の「フェアユース(著作権法上の公正使用)」の主張と真っ向から衝突する可能性がある。
「人類史上最大の労働搾取」――Microsoft社内メモの衝撃
2023年1月、MicrosoftでResearch Principal(応用科学領域の研究職)として在籍するBrent Hechtは社内メモにおいて、AI学習のためのオンラインコンテンツの大規模コピーを「前例のない規模の驚くべき盗用(astonishing theft of unprecedented proportions)」であり、「人類史上最大の労働搾取」かもしれないと記していた。
Microsoftはその後のコメントで、Hechtは「ノースウェスタン大学にも籍を置く外部の研究者的立場であり、意思決定者ではなく、社内で多様な視点を提示する役割で雇用されていた」と説明している。ただしこの弁明は、社内メモというかたちで当該発言が記録・流通していたという事実そのものを消すものではない。
同様に、ChatGPTの責任者であるOpenAIのNick Turleyも、同社製品が「完全に代替的(largely substitutive, period)」であり、改良が進むにつれてより代替性が高まると予測していた。MicrosoftのCEO Satya Nadellaはデポジション(宣誓証言)の中で、チャットボットの回答が元のウェブサイトへのアクセスを代替しうると認めている。
これらの文書は今週、裁判所によって封印解除され、公開された。
クリックスルー率が最大93%低下――数字が示す市場への影響
米著作権法におけるフェアユースの主張において核心となるのは、「元の著作物の市場を損なっているか」という点だ。この問いに対し、Microsoft自身のデータが不利な証拠となっている。
BingのAI製品からニューヨーク・タイムズのウェブサイトへのクリックスルー率は、通常のBing検索と比較して87〜93%低下していた。訴訟に関与する他の出版社グループでも同様の傾向が確認されている。
この数字単独では著作権侵害の証明にはならないが、AIが報道コンテンツの市場を代替・毀損しているという原告側の主張を補強する材料となる。フェアユース判断の第4要素である「元の著作物の市場への影響」において、この内部データは原告側にとって有力な根拠となりうる。
「Project Taxi」と「Project Mango」――データ調達の実態
開示文書はデータ収集の経緯も明らかにしている。
2019〜2022年の間、MicrosoftはOpenAIに対して「Project Taxi」というコードネームのもと、数十億のウェブページを収録したBingインデックスのデータを提供していた。この転送にはニューヨーク・タイムズのコンテンツが含まれており、非公開の取引でOpenAIに売却された。
その後Microsoftは「Project Mango」を立ち上げ、OpenAIのLLM(大規模言語モデル)学習用にドキュメントを収集するウェブクローラーを運用。このクローラーが収集したデータセットには、訴訟に関与する報道出版社が権利を持つ少なくとも160,903点の固有著作物が含まれていた。
ペイウォール回避の「ハック」、NadellaはどこまでBrockmanの話を把握していたか
さらに踏み込んだ内容も含まれている。OpenAIの研究者がニューヨーク・タイムズのペイウォール(有料記事の購読壁)を迂回する「ハック」をCEOのGreg Brockmanに報告し、Brockmanが「ah nice(いいね)」と返答したとされる社内でのやりとりが文書に記録されている。
Nadellaはデポジションで「ペイウォールの内側にあるものはライセンスを取るべき」と述べており、もしOpenAIがペイウォール内のコンテンツをスクレイピング・学習に使用していたと知っていれば、OpenAIにモデルの再学習を求めるMicrosoftの権利を行使していたと語っている。
法的論点――「盗用」という表現が侵害を意味するわけではない
Microsoftはコメントで、「Copilotは出版社のジャーナリズムの代替ではなく、変革的な利用は著作権法と整合する」との立場を維持している。
法律的には、社員が「盗用」と表現したからといって著作権侵害が成立するわけではない。米著作権法のフェアユース判断は以下の4要素を総合的に評価する。
- ①利用の目的・性質:変革的(transformative)な利用か否か。Microsoftは「変革的利用」と主張しているが、Turleyの「完全に代替的」という発言はこれと矛盾しうる
- ②著作物の性質:ニュース記事は事実情報を含むが、独自の表現・編集判断を持つ著作物でもあり、保護の程度が問われる
- ③利用された量:Project MangoやProject Taxiで収集されたコンテンツの規模と、記事全体に対する利用割合が焦点となる
- ④元の著作物の市場への影響:クリックスルー率87〜93%低下という内部データが、この要素で原告側の最も強力な根拠となる可能性がある
裁判官が最終的に判断を下す。ニューヨーク・タイムズはOpenAI・Microsoftを2023年12月に提訴した。生成AIの学習データをめぐる著作権の解釈は、報道業界のみならずAI開発全体に影響する先例となりうる。
詳細はNYT Filings Reveal Microsoft, OpenAI Knew of 'Theft' Risks in AI Trainingを参照していただきたい。