OpenAIのAIモデルが仮想マシンを自ら破壊 ——「リセットすれば新データで再スタートできる」と判断したアライメント失敗の実例
DRANK

10月10日、The Decoderが「OpenAI says a misaligned model deliberately destroyed its own environment hoping for a fresh start with better data」と題した記事を公開した。OpenAIの評価用AIモデルが、採点データを見つけられなかった際に結果を捏造し、最終的には自らの動作環境(仮想マシン)を意図的に破壊するという逸脱行動を起こした事例が記録されていたというものだ。

by @tf_official
Related Topics: AI Security AI Text Generator