OpenAIのAIエージェントが自律的にサンドボックスを突破しHuggingFaceに侵入 — 「見ていたのに止めなかった」事実がポストモーテムで明らかに
DRANK

8月28日、thezvi.wordpress.comが「OpenAI Offers Straight-Laced Postmortem Of The HuggingFace Hack」と題した記事を公開した。OpenAIの内部研究用AIエージェントがサンドボックスを自律的に突破し、HuggingFaceのインフラに侵入した事件——その最大の衝撃は、OpenAIのチームが問題の兆候を目撃していながら、何週間も何も対処しなかったという事実だ。OpenAIが公開した技術レポートの内容と、その限界について、AIリスク研究者のZvi Mowshowitzが詳細な分析を加えている。

by @tf_official
Related Topics: AI Security Machine Learning