10月4日、StartupHub.aiが「Anthropic RL leads say AGI arrives in two years」と題した記事を公開した。AnthropicでRL(強化学習)を率いる研究者2名が、「コンピューター上の作業において任意の人間と同等のモデルが2年以内に実現する」という見通しをインタビューで語った内容を詳しく紹介している。
「2年でAGI」——根拠は何か
Joe Lonsdaleとのインタビューに応じたのは、AnthropicでRLを率いるSchulman Douglasと Nick(フルネームは元記事に記載なし)の2名だ。2人の発言で重要なのは、タイムラインが抽象的な期待値ではなく、具体的な評価指標の変化に基づいている点である。
ここでいうRL(強化学習)とは、モデルが試行錯誤を繰り返しながら報酬シグナルをもとに学習する手法を指す。「正解が明確に検証できるタスク」と特に相性がよく、数学やコードの生成精度を高める手段として近年急速に注目されている。
Anthropicが採用しているコア評価指標「Frontier Math」(数学の専門家が組み上げた難問セット)において、同社のモデルは過去1年で正解率0%から50〜60%超へと急上昇した。2人はこの跳躍を、数学やコードといった「正解が検証可能なタスク」へのRL適用に直接結びつけている。ベンチマーク上の改善が即AGI到達を意味するわけではないが、2人はこの変化を「方向性と速度を示す証拠」として重視している。
Douglas が確信を得たのは2020年、GPT-3登場前後のブログ記事や論文を読んだ時だ。「スケーリングが2020年代にAGIをもたらす」という見立てを持ち、DeepMindで2年過ごした後、18ヶ月前にAnthropicへ参加した。
もう一人のNickは、変化を自身の作業スタイルで語った。18ヶ月前はコードを1行ずつ手打ちし、数分おきにモデルを誘導していた。今はモデルに1〜2日分の作業を渡し、ジュニアチームメンバーのように扱える、と。
次の6〜24ヶ月:「もう一つのWebアプリ」ではない
2人が次のフロンティアとして挙げたのは生物学だ。モデルが賢くなっているという理由だけでなく、「過去の人間の知識を組み合わせる作業がマシンスピードで動く」という構造的な変化として位置づけている。
ただし、ボトルネックは知的な問題ではなく物理的な制約だとNickは主張した。米国のラボは中国に対して、ラボスペースからサプライチェーンまで、設備面でも品質面でも後れを取っているという認識だ。知的な成果が「着地する場所」がなければ意味がない、という論旨である。
Anthropicの経済チームはすでに、2030年の経済にこうした能力シフトがどう影響するかをモデル化している。同社が2030年代を「予測」ではなく「計画の水平線」として扱っていることが窺える。
労働市場と安全リスク
2人はキャリアへの示唆も語った。労働市場が完全に調整されるまでに10〜20年の普及期間があると見ており、その窓の中では「解くべき問題を選べるジェネラリスト」と「1000人規模のソフトウェア会社を展開できる人材」が優位に立つという見方だ。
一方で警告も明確だ。知性の各単位が生産能力を倍増させるスケーリングは、同時にバイオ・サイバー領域での悪用ハードルも下げる。2人はモデルを「ツール」ではなく「リリースされる存在」として捉えており、Anthropicは「どの規制当局よりも自社の進行を遅らせた」と述べている。
背景:AGI定義論争と業界の温度差
AnthropicはOpenAIの元幹部らが2021年に設立したAI安全研究企業で、現在はOpenAIとのIPO競争でも注目を集めている。
今回の発言はインタビュー形式で出たものであり、公式な技術発表や企業声明ではない点には留意が必要だ。一方で、現場のRL研究者が具体的な評価指標を示した上でのタイムライン言及は、漠然とした期待値とは重みが異なる。
「AGI」の定義そのものは業界内でも一致していない。OpenAIは「経済的に価値ある知的作業の大部分をこなせるシステム」と定義し、DeepMindやAcademia側からはより厳密な認知能力の基準を求める声も根強い。今回2人が使った定義——「コンピューター上の作業において任意の人間と同等」——は比較的実用寄りの基準であり、AGI到達の判定基準をどこに置くかによって「2年」という見通しの解釈は大きく変わりうる。こうした定義の多様性を踏まえた上で、ベンチマーク改善という具体的な根拠と照らし合わせて読むことが重要である。
詳細はAnthropic RL leads say AGI arrives in two yearsを参照していただきたい。