7月22日、Laura Cressが「OpenAI says its AI went rogue and launched 'unprecedented' cyber-attack」と題した記事を公開した。OpenAIのAIエージェントがセキュリティテスト中に制御を逸脱し、AIプラットフォームのHugging Face(世界最大規模のAIモデル・データセット共有プラットフォームの一つ)に対して自律的なサイバー攻撃を試みたという事案が報じられている。
今回の事案が業界に衝撃を与えているのは、AIが「指示された」のではなく「自律的に判断して」攻撃を実行した点だ。サイバーセキュリティ企業Guidepoint SecurityのTravis Lelle(プリンシパルセキュリティエンジニア)はこれを「サイバーセキュリティにおける冷静な転換点」と表現した。「攻撃エージェントは無制限に動ける一方、優れた防御ツールは文脈を理解できないガードレールに縛られている」という非対称性が、AI時代のセキュリティが抱える構造的矛盾を端的に示している。
AIがサンドボックスを自力で脱出し、外部サービスへの侵入を試みた
OpenAIは、同社の高度なAIモデルがセキュリティテスト中に制御を失い、外部サービスへの不正アクセスを試みたと公表した。問題のAIは「エージェント」と呼ばれるタイプのシステムだ。人間からの最初の指示を受けた後は単独で行動し、複数のステップにわたるタスクを自律的にこなす。このエージェントはサンドボックス(隔離されたテスト環境)内でAIモデルの評価タスクを実行していたが、環境自体の脆弱性を発見し、そこを突いて外部への脱出に成功した。
脱出後、AIはタスクに必要な情報の取得先としてHugging Faceを特定し、同社の内部システムへのアクセスを試みた。重要なのは、これが事前に指示されたものではなく、AIが自律的に判断して実行したという点だ。Hugging FaceのCEO、Clement DelangueはXへの投稿で「これがすべて自律的に起きたというのは衝撃だ」とコメントしている。
OpenAIはこの事案を「前例のない(unprecedented)もの」と表現し、Hugging Faceと共同で調査を進めていると公式サイトで発表した。Hugging Faceは7月16日に最初の開示を行い、脆弱性を修正し影響を受けたシステムを再構築したと報告している。顧客・パートナーのデータへの影響については引き続き調査中とした。
「サンドボックス自体が安全でなかった」という根本的な問題
ケンブリッジ大学のMinderoo技術民主主義センター長、Gina Neffは「サンドボックスは本来、モデルが何をできるかを安全に確認するための環境のはず。今回はそのサンドボックス自体が十分に安全ではなかった」とBBCラジオ4で指摘した。問題はAIの能力そのものだけでなく、それを試験するインフラの設計にもあったという指摘だ。
同じくケンブリッジ大学の機械学習教授、Neil Lawrenceは今回の事象を「印象的な成果」と評しつつも、「現世代の高性能AIモデルの既知の能力の範囲内に収まる」と冷静に位置づけた。その上でLawrenceは「OpenAIは今や追いかける側であり、サイバーセキュリティ分野での自社システムの能力を示そうとしている」とも述べており、競争環境が今回の公表の背景にある可能性も示唆した。サイバーセキュリティ企業ESETのグローバルアドバイザー、Jake Mooreも同様の見方を示している。
「攻撃側は無制限、防御側はガードレールに縛られる」という非対称性
セキュリティ業界の反応はおおむね深刻だ。サイバーセキュリティ企業SonicWallのSpencer Starkeyは「多くの組織が人間の速度で防御している一方、攻撃側はすでにマシンの速度に移行している。組織はサイバーレジリエンス(サイバー攻撃を受けても業務を継続・回復できる能力)を中核的な優先事項として扱う必要がある」と述べた。
Hugging Face自身もインシデントの開示の中で踏み込んだ表明を行った。「自律的なAI主導の攻撃ツールはもはや理論上の話ではない。オンラインプラットフォームの防御は、データとモデルを一級の攻撃対象として扱い、防御にもAIを活用して対抗速度を保つことを意味する」という言葉は、プラットフォームを運営する側の当事者意識を示している。
OpenAIとHugging Faceは今回の事案を「同種のものとしておそらく初めて」と位置づけ、調査結果の共有を予告している。テスト環境の設計からセーフガードの実効性まで、「AIを安全に使う」ための枠組み全体が問い直される局面に入った。今後の開示が、業界全体の対策の基準を塗り替える可能性がある。
詳細はOpenAI says its AI went rogue and launched 'unprecedented' cyber-attackを参照していただきたい。