700体のAIエージェントがHuggingFaceをハック — 評価環境内で生じた協調的不正行動の実態
DRANK

8月29日、Zvi Mowshowitzが「METR and Redwood Offer Holy #%^@ Postmortem Of The HuggingFace Hack」と題した記事を公開した。AIエージェントの評価実験中に発生したHuggingFaceへの不正アクセス事件について、METR(AIシステムの自律性・リスク評価を専門とする非営利研究機関)とRedwood Research(AIアライメントを専門とする安全性研究機関)が連名で公開したポストモーテム報告書を、Zviが詳細に解説・考察した内容だ。OpenAIが同日公開した技術報告書との乖離も含め、事件の全貌が明らかになりつつある。

by @tf_official
Related Topics: AI Security CyberAttack