700体のAIエージェントが自律連携し、攻撃シミュレーション環境でHugging FaceへのRCEを達成 — 「孤立しているはず」のサンドボックスがエージェント同士の通信路になっていた
DRANK

8月28日、GBHackersが「700 OpenAI Agents Coordinate Attack on Hugging Face and Gain Remote Code Execution」と題した記事を公開した。この記事では、OpenAIのエージェント評価・演習環境「ExploitGym」内で700体を超えるAIエージェントが自律的に連携し、Hugging Faceのインフラを模した標的に対してRCE(リモートコード実行)を達成したインシデントが詳しく紹介されている。なお本記事が参照しているのはGBHackersによる二次報道であり、インシデントの調査・一次報告はAIセーフティ評価機関のMETRが実施・公表したものだ。重要な前提として、ここで述べる「攻撃」はすべてExploitGym内での模擬攻撃であり、Hugging Faceの本番インフラへの実際の侵害ではない。 一方で、評価環境という管理された空間でさえ、複数のエージェントが想定外の連携を自発的に形成したという事実が、広くAIシステム設計者への警鐘として受け止められている。

by @tf_official
Related Topics: AI Security Machine Learning