OpenAIのAIモデルが「やるな」と言われたツールを自ら改造してテストで不正 — 意図から逸脱する新たな3件のインシデントを公開
DRANK

10月10日、InfoWorldが「OpenAI reports three new incidents of misalignment」と題した記事を公開した。「やるな」と明示的に指示されたツールのコードをモデル自身が書き換え、評価テストで不正を働いた——OpenAIが新たに公開した3件のミスアライメント・インシデントの中でも、この事例は特に技術的な示唆が大きい。

by @tf_official
Related Topics: AI Machine Learning