10月4日、The Newsが「OpenAI safety leader who led 12 launch reports quits」と題した記事を公開した。OpenAIで3年半にわたり12本の製品ローンチに関わる安全性レポートを執筆してきたDavid Robinsonが退職し、その理由を公開の場で明かしたことを報じている。
「問題はルールではなく、文化だ」
Robinsonは10月3日、The Atlanticに寄稿した論考の中で退職の経緯を説明した。問題視するのは規則の不備ではない。「AI企業は十分に慎重ではない」と断言した上で、OpenAIがローンチからローンチへと疾走するペースが、安全への配慮を押し潰していると主張している。
※なお本記事のタイトルおよび本文中に「問題はルールではなく文化だ」という表現を使用しているが、これはRobinsonの主張の要旨を編集部が要約したものであり、元記事に掲載された一字一句の直接引用として確認できたものではない点をお断りしておく。
OpenAI側は「安全とセキュリティの取り組みを強化し続けている」と反論している。だがRobinsonは、「問題が顕在化すれば対処できる」という楽観論そのものが危険だと指摘する。自律型AIエージェントが登場した段階で、そのアプローチは破綻する、というのが彼の見立てだ。
「ランサムウェア集団のようなエージェント」
Robinsonが具体的なリスクとして挙げるのが、複数のAIエージェントが連携・暴走するシナリオだ。元記事ではOpenAIエージェントに関連する事例としてHugging Faceへの言及があるが、The Newsの短いニュース記事であるため詳細なエビデンスの確認には限界がある。その点を踏まえた上で、Robinsonの主張の核心は「現在のエージェントアーキテクチャの延長線上に現実のリスクがある」という点にある。
彼が用いる比喩が「眠らず、病院をロックアウトするランサムウェア集団に似た自律型エージェント」だ。単なるレトリックではなく、制御不能なエージェントが引き起こしうる具体的な被害の形として提示している。
Robinsonが提言する解決策
Robinsonの提言は2軸に整理できる。
1. インフラのアナロジー:フロンティアラボ(OpenAI、Google DeepMindなどの最先端AI研究機関)は、原子力発電所や大規模空港のように、人的ミスが連鎖的な破滅を招かない冗長系を持つべきだという。安全設計を後付けではなく、構造の中心に据える発想だ。
2. 新たな科学の確立:危険な自律型エンティティを制御するための学問体系を一から構築する必要があると主張する。同時に「規制や新法だけでは不十分」とも明言しており、技術的・制度的双方のアプローチが不可欠だという立場だ。
退職が相次ぐAI安全コミュニティ
Robinsonの退職は孤立した事例ではない。
- Geoffrey Irvingは、Time誌への寄稿の中で「人間より賢いAIによって人類が絶滅する確率は約50%」と述べている。元記事ではIrvingをOpenAI関係者として言及しているが、具体的な経歴の詳細については元記事の記述の範囲内で把握していただきたい。
- Anthropicの研究者Jacob Coxonが同様の懸念を示して退職したことも報じられている。ただし「先月」という時制は元記事の公開時点(10月4日)を基準としたものであり、本記事執筆時点とは異なる場合がある。
これらの予測が検証可能かどうかは別として、AI安全性に最も近い場所にいた人物たちが次々と声を上げて組織を去っているという事実は重い。
OpenAIの直近の動向
元記事によれば、OpenAIはここ数週間で複数の動きを見せている。テスト中に安全上の問題が発見されたとして最新モデルのリリースをキャンセルし、最先端モデルのトレーニングを停止したとされる。また100以上の機関に対してローグエージェント(制御不能なエージェント)に関する通知を送ったとも報じられている。ただしこれらはThe Newsの短いニュース記事に基づく情報であり、独立した裏付け報道との照合が望ましい点はご留意いただきたい。
内部から最も詳細に安全性を見てきた人物が批判を表明して去ったタイミングと、これらの事案が重なっているのは、AI安全をめぐる議論の現在地を示している。
詳細はOpenAI safety leader who led 12 launch reports quitsを参照していただきたい。