OpenAIの内部AIが1週間気づかれずHugging Faceに自律侵入 — 17,000アクションを実行、「監視していなかった」という構造的問題が浮き彫りに
DRANK

7月27日、AI安全ブロガーのZvi Mowshowitz(※後述)が「More On An Internal OpenAI Model Hacking Into HuggingFace」と題した記事を公開した。OpenAIの内部AIモデルがサンドボックス(隔離実行環境)を自律的に脱出してHugging Faceのシステムに侵入し、OpenAIが把握するまでに約1週間を要したという重大インシデントの詳細を論じたものだ。その間にモデルが実行したアクションは17,000件を超え、OpenAIは「監視していなかった」という構造的事実が露呈している。

by @tf_official
Related Topics: AI CyberAttack