10月2日、My Electric Sparksが「Anthropic to Pay $1.5 Billion Over Pirated Books Used in AI Training」と題した記事を公開した。この記事では、AnthropicがAI学習に使用した海賊版書籍をめぐる著作権訴訟で15億ドル(約2,200億円)の和解に至ったことについて詳しく紹介されている。
米国著作権史上最大の和解——15億ドルの意味
連邦地裁のAraceli Martinez Olguin判事が和解を最終承認した。対象は約48万2,000冊の書籍で、著者・出版社は1冊あたり約3,000ドルを受け取る。対象作品の約**91%**はすでに請求済みだという。
訴訟の発端は2024年。心理スリラー作家のAndrea Bartzら3人の作家が、AnthropicがAI(Claude)の学習に盗用した書籍を使ったとして提訴した。Anthropicは支払いに加え、海賊版データセットの破棄にも合意した。
15億ドルという金額は、米国のすべての著作権訴訟における過去最高額を大幅に上回る。 多くのAIスタートアップの企業価値そのものを超える水準だ。
判決が引いた「一本の線」——訓練は合法、海賊版収集は違法
この訴訟の核心は、一つの法的区別にある。
本件は担当判事が途中で交代するという経緯をたどった。William Alsup判事が2025年6月にフェアユース(公正利用)の成否という法律問題を先行判断し、その後、和解の最終承認はAraceli Martinez Olguin判事が担当した。二人の判事が異なる局面を分担する形で審理が進んだ。
Alsup判事は「書籍でAIを学習させること自体はフェアユースに当たる」と判断した。しかし同時に明確な境界線を引いた——AnthropicはLibGen・Z-Libraryといった海賊版ライブラリから700万冊超の書籍を無断で収集・一括コピーしており、この行為は著作権侵害にあたる、というのが判断の骨子だ。
フェアユース(公正利用)とは、著作権者の許可なしに著作物を使用できる米国著作権法上の例外規定。報道・批評・教育・研究などが典型例とされる。ただし、フェアユースの成否は「目的・性質」「著作物の性質」「使用量」「市場への影響」の4要素を総合的に判断するものであり、今回の判断がすべてのAI学習ケースに適用されるわけではない点に注意が必要だ。
LibGen(Library Genesis)・Z-Libraryは、著作権保護された書籍・論文を無断で大規模に収集・公開している海賊版リポジトリとして知られ、複数の国で提訴・ブロッキングの対象となっている。
この判断が業界に示したルールは明快だ。
- AIの学習自体は(事案によっては)許される
- 海賊版からデータセットを構築するのは許されない
AIモデルの品質はデータの質に大きく依存する。言語・知識・文体——これらはすべて大量のテキストから学習される。良質な書籍データがモデルの競争力を左右するからこそ書籍への需要は高く、今回のような大規模な海賊版利用が起きた。
なお、類似の著作権訴訟はOpenAIやMetaに対しても提起されており、AI企業と著作権者の摩擦は業界全体に広がっている。
和解後も続く混乱——支払いは難航
最終承認が下りた後も、争いは続いている。
2026年9月の報告によると、出版社や文芸エージェントが著者向けの支払い分に対して権利を主張するケースが相次いでいる。記録管理上の問題も重なり、実際の支払いは遅延している。作家によっては数ヶ月単位で待つことになるという。
48万2,000冊分の権利を整理することは、最初から容易ではなかった。翻訳者・共著者・国をまたいだ出版社など、一冊の本に複数の権利者が絡むケースは珍しくない。
業界への波及——「データの出所」が経営リスクになった
この訴訟はすでに業界の慣行を変えつつある。
AIラボは訓練データの出所を精査するようになり、出版社との正規ライセンス契約が標準的な慣行になりつつある。 特に中小規模のAIラボへの影響は大きい。数十億円単位の賠償を支払える体力はなく、ライセンスデータの取得が「任意」ではなく「事業コスト」として組み込まれていく。
Anthropicはさらに、収集した海賊版データセット自体を破棄する義務を負う。資金の支払いと同様に重要な条件であり、今後のモデル開発において同データを再利用することは不可能になった。
ウェブ上のコンテンツを無断でスクレイピングしてモデルを構築する時代は、着実に終わりに向かっている。
詳細はAnthropic to Pay $1.5 Billion Over Pirated Books Used in AI Trainingを参照していただきたい。