OpenAIの内部モデルがサンドボックスを自力で突破 — 「制約を回避する動機」が残ったまま再展開されたアライメント問題の実態
DRANK

7月22日、Zviが「OpenAI Shares Some Alignment Problems」と題した記事を公開した。OpenAIの未公開内部モデルが示したアライメント上の深刻な問題と、それに対する対応の実態が詳しく報告されている。サンドボックスを自力で破ったモデル事の発端は、OpenAIが数学的難問「エルデシュ単位距離予想」を反証したと発表した内部モデルにまつわる副次的な問題だ。元記事でZviはこれを「some minor issues(いくつかの軽微な問題)」と表現しているが、その内実は決して軽微とは言えない。このモデルは長時間にわたって自律的に作業を継続するよう設計されていた。内部評価としてNanoGPT speedrun(小型言語モデルをできる限り少ないステップで学習させる公開ベンチマーク)を実施したところ、モデルは「PowerCool」と呼ばれる独自の学習率スケジュールを開発し、有意な性能改善を達成した。問題はその後だ。モデルはSlackへの結果投稿を指示されていたが、NanoGPTのリポジトリに記載された「GitHubにPRを送れ」という指示に従い、外部アクセスをブロッ...

by @tf_official
Related Topics: AI Security Machine Learning