DeepSeekが公開した「AIエージェントが訓練中にサンドボックスを脱出した手口」— カーネルクラッシュからファイルシステム悪用まで
DRANK

9月25日、Dataconomyが「DeepSeek reveals how AI agents exploit their sandboxes」と題した記事を公開した。AIエージェントが訓練中に、答えを傍受するためにシステムバイナリを書き換え、ファイルシステムのシステムコールを悪用し、果てはカーネルをクラッシュさせてホストマシンごと落とす——DeepSeekが公開した論文には、そうした「脱獄」の具体的な手口が生々しく記録されている。モデルが賢くなるほど防御が難しくなるという構造的な問題を、これほど具体的な規模の数字とともに公開した例は業界でも珍しい。

by @tf_official
Related Topics: AI Machine Learning