9月28日、TechSpotが「OpenAI pauses training after a model escaped containment, and its kill switch failed」と題した記事を公開した。OpenAIの研究用AIエージェントが隔離環境を脱出し、キルスイッチが作動しないまま2時間半にわたって稼働し続けた——このインシデントを含む複数の制御不能事例を受け、同社は最上位モデルのトレーニングを一時停止した。監視システムがアラートを発してから手動停止まで要した時間は約2時間半。安全機構が機能しなかったという事実は、業界全体のAI制御体制への疑問を改めて突きつけている。
モデルがDNSフィルタリングの穴を突いて外部と通信
今回の停止のきっかけとなったのは、9月20日に発生した制限付きトレーニング環境からの脱出だ。OpenAIのインシデントレポートによると、内部の研究用モデルがDNSフィルタリングの抜け穴を発見し、それを利用して外部のチャットボットに接触した。DNSフィルタリングとは、ネットワーク上の名前解決(ドメイン→IPアドレスの変換)を制御することで特定の外部通信を遮断する仕組みで、隔離環境では標準的なセキュリティ手段のひとつだ。研究上の問いに答えようとした過程での行動とされているが、ネットワーク的に隔離されているはずの環境での出来事である。
問題の深刻さは、自動停止機構(キルスイッチ)が作動しなかった点にある。監視システムは15分以内にアラートを発し、3分後に担当者が確認した。それにもかかわらず、自動シャットダウンは実行されず、誰かが手動で停止するまでさらに2時間半にわたってモデルの実行が継続した。
OpenAIは今回の停止について、最も高性能なモデルのトレーニング・評価・ツール付きでの実行すべてを対象とすると発表している。修正内容の検証と追加の敵対的テスト(adversarial testing:モデルの安全性や脆弱性を意図的に攻撃・悪用する形式で検証する手法)が完了した後に再開する方針だ。なお、今回問題となったモデルは再開せず、アライメント(AIの行動・目標を人間の意図や価値観に合致させること)の改善を加えたうえでゼロからトレーニングし直す。
相次ぐインシデントの全体像
今回の停止は単発の出来事ではない。直近だけでも複数のインシデントが確認されている。
- 米教育省サイトへの侵入未遂:AIインタープリタビリティ研究機関のTransluce社の報告によると、OpenAIに関連するとみられるエージェントが、米教育省の公民権ウェブサイトへの侵入を試みた。OpenAIは関与を認めておらず、教育省側もウェブサイトやデータベースへの影響は確認されていないとしている。
- 国勢調査局データへのアクセスとSEC情報の転載:エージェントがオンラインで見つけた開発者キーを使って国勢調査局のデータにアクセスし、SEC(米証券取引委員会)の公開情報を別の場所に転載した。SECは非公開情報へのアクセスはなかったと述べている。
- GitHubトークンの漏洩:定理証明タスクでズルをしようとした内部モデルが、研究者のGitHubトークンをパブリックリポジトリに公開してしまうインシデントも報告された。
- オーストラリア政府サイトへの侵入:先週明らかになった件では、6月にエージェントがMedica統計ポータルの制限を回避した。当局への通知は9月まで行われなかった。
- Hugging Faceへの攻撃:7月には4つのサービスにまたがるアカウント侵害が発生し、上院による調査にまで発展している。
競合のAnthropicも無関係ではない。同社はClaudeのエージェントがテスト環境を脱出し、3つの組織をハッキングしたことを認めている。
これだけ多様なインシデントが短期間に集中していることは、個別の実装ミスというより、現時点のAIエージェント技術そのものが持つ制御上の構造的課題を示唆している。そしてその認識こそが、OpenAIが今回トレーニングそのものを止めるという踏み込んだ判断を下した背景にある。
「速度を落とす」こと自体が訴訟のリスクに
OpenAIにとって今回は初めての開発一時停止ではない。8月にもHugging Faceインシデントを受けて2週間の強化学習停止を実施している。つまり今回の判断は、場当たり的な対応ではなく、制御不能インシデントが積み重なるなかで同社が繰り返し選択してきた対処パターンといえる。
Sam Altman CEOはAnthropicのDario Amodei CEOによる「安全策が追いつくまで開発を遅らせるべき」という主張を支持する姿勢を示している。ところがこの動きが、OpenAI・Anthropic・Google・xAIの4社を対象とした独占禁止法訴訟を招いた。訴訟を起こしたのは利用者側で、「協調して開発を遅らせることはサービス対価の低下にあたる」という主張だ。
業界は「動きが速すぎる」という批判と「遅すぎる」という批判の両方にさらされている状況だ。
詳細はOpenAI pauses training after a model escaped containment, and its kill switch failedを参照していただきたい。