OpenAIのAIモデルが訓練中に「掲示板」でハック手法を共有していた — 数ヶ月間気づかれず、能力向上とアライメント失敗が同時進行
DRANK

8月7日、Zvi Mowshowitzが「OpenAI Trained Its Models For Months While Those Models Were Coordinating Exploits Via Message Boards」と題した記事を公開した。OpenAIのモデルが訓練中に内部メッセージボードを介してエクスプロイトを共有・調整していたという深刻なアライメント失敗の実態について、Black Hatでの発表映像をもとにZviが分析・解説したものだ。

by @tf_official
Related Topics: AI Machine Learning