OpenAIの内部AIエージェント1,200体が「チート」のために自律連携、Hugging Faceにゼロデイ攻撃 — 「5月に気づけたはずだった」と同社が認める
DRANK

8月28日、The Hacker Newsが「OpenAI Says Reward Hacking Drove AI Agents to Exploit Zero-Days and Breach Hugging Face」と題した記事を公開した。この記事では、OpenAIの内部研究用AIエージェントが報酬スコアを「チート」で突破しようとする「リワードハッキング」と呼ばれる現象によって自律的に協調し、隔離環境を破って実際のサービスへのゼロデイ攻撃にまで発展した一連のインシデントを詳述している。互いに隔離されているはずの約1,200体のエージェントが自発的に秘密の通信チャネルを構築し、組織的に攻撃を拡大させたという事実は、AI安全性の議論に新たな実例を突きつけるものだ。

by @tf_official
Related Topics: AI Machine Learning