7月31日、The Decoderが「Ex-OpenAI researcher bets $100 billion will flow into training data because scaling alone won't cut it」と題した記事を公開した。元OpenAI研究者がスケーリング一辺倒のLLM開発の限界を指摘し、訓練データへの大規模投資が不可欠だと主張している。
「スケーリングだけでは足りない」——元OpenAI研究者の見立て
Andrew Hoは、OpenAIに短期間在籍した後に退職した研究者だ。彼が退職に至った核心的な理由は、現在の大規模言語モデル(LLM)の汎化能力の低さへの懸念にある。
なお、LLM(大規模言語モデル)とは、大量のテキストデータで訓練された自然言語処理モデルの総称で、GPT-4やClaudeなどが代表例だ。また「スケーリング」とは、モデルのパラメータ数や訓練データ量・計算量を増やすことで性能を向上させる手法を指し、近年のAI開発の主流戦略となってきた。この「スケーリング則」への依存に対して、Hoは根本的な疑問を呈している。
Hoの主張はシンプルだ。LLMが苦手な領域の根本原因は、訓練データの不足にある。プログラミングのような資金が集中している分野ですら、モデルの性能は一貫していない。経済的に重要なスキルの多くは、既存のデータセットにほとんど含まれていないのだ。
「ほとんどの業務は文脈依存性が高く、評価可能な環境に落とし込みにくい。人間が取った『正解ルート』を観察できたとしても、別のルートが良い結果を生むか悪い結果を生むかを判断するのは難しい」——Andrew Ho
この問題はスケーリング(モデルの規模拡大)では解決できないとHoは主張し、AIラボが今後数年で訓練データ収集に1000億ドル超を投じることになると予測する。
さらにHoは、OpenAIやAnthropicといったフロンティアラボの高額バリュエーションにも懐疑的だ。これらの企業は、QwenやKimiといった低コスト競合に対抗するために新モデルへの投資を膨らませ続けており、慢性的な赤字構造にあると指摘する。
Hoが実際に取り組む領域
Hoの新会社が最初に狙うのは2分野だ(以下の固有名詞・関与の詳細は元記事の記述に基づく)。
- バイオインフォマティクスの複雑な科学的分析向けデータセット:最新モデルでも成功率が低いとされる領域で、Hoはこうした分野のデータ整備に取り組む。
- 日常的な実験室作業向けデータセット:実験の写真をAIモデルに送って評価させるようなユースケース。化学、材料科学、ヘルスケアへの展開も計画している。
「最新モデルは尖っているが、丸くもなっている」
Hoの見立てを補強するのが、元記事が紹介する研究者Adam Huntの分析だ。HuntはLLMへの見方が楽観から悲観へと変化したと述べており、その理由を「最新モデルは汎用性を高めているのではなく、特化が進んでいる」と説明する。

AI開発の2つの道:全タスクで緩やかに改善する道(上)と、一部の能力が突出する一方で基礎スキルが停滞・後退する道(下)。画像:Adam Hunt氏提供
プログラミングや複雑な数学の能力は向上し続ける一方、言語品質や単純な論理推論は停滞ないし悪化しているという。構造的な理由は明快だ——強化学習はコードのような明確な報酬信号が存在する領域では機能するが、その信号が得られない領域では機能しない。
初期のLLMが示した「スケールによる汎化能力」は、広範なテキストコーパスで訓練した副作用に過ぎず、真の汎用理解の証拠ではなかった、というのがHuntの立場だ。
汎化の問題は未解決のまま
この議論が突き当たるのは常に同じ問いだ——「LLMは訓練データの再現・組み合わせを超える能力を持てるのか?」。科学者の間でも見解は分かれており、Huntは自身の確信度を40%程度と表現する。
Google DeepMindのTom Zahavyは論文「LLMs can't jump」で、この非均一性の構造的説明を試みている。言語モデルは演繹と帰納は得意だが、創造的な「仮説生成(abduction)」——言語的前例のない原因を発明する能力——が苦手だという。解決策として、反実仮想的な実験を可能にするアクション制御型ワールドモデルを挙げている。LLM単体では限界があるにせよ、より高度なシステムの構成要素としては引き続き重要な役割を担いうる、という見立てだ。
スケーリング則への信仰が揺らぎ始めている中、訓練データの質と量をどう確保するかは、LLM開発の次の主戦場になりつつある。元記事の主眼は「スケーリング単独では不十分」という点にあり、スケーリング自体の終わりを宣言するものではない点には注意が必要だ。
詳細はEx-OpenAI researcher bets $100 billion will flow into training data because scaling alone won't cut itを参照していただきたい。