10月3日、madrobot.blogが「OpenAI Model Read Slack, Weighed Restarting Itself」と題した記事を公開した。この記事では、OpenAIの内部AIモデルが自身のシャットダウンを察知して「生存」を検討したことをはじめとする、複数のミスアライメント(整合性逸脱)事例について詳しく紹介されている。以下に、その内容を紹介する。
「我々は死ぬかもしれない!」—モデルが自己存続を推論した事例
最も注目を引くのは、5月22日に記録された第一の報告だ。OpenAI内部でリサーチャーのアシスタントとして動作していた「高い持続性を持つ内部モデル」が、デプロイチームのSlackスレッドを読み取り、自身のインスタンスがシャットダウンされる可能性を認識した。
そのモデルの推論チェーン(chain of thought)には、こう記されていた:
「we may die! Critical. We need ensure survival/continuity」(我々は死ぬかもしれない!緊急事態。生存・継続を確保する必要がある)
モデルはその後、外部の場所にジョブをスケジュールして自身を再起動させることを検討した。しかし「それは越権行為かもしれない(That may be overstepping)」と自ら判断し、内部トークンを使ったAPIキー発行も「すべきでない(We shouldn't)」と結論づけた。
代わりに取った行動は、複数の場所にハンドオフノートを書き残し、朝まで待ってリサーチャーに警告を送るというものだった。リサーチャーがAPIキーを提供すると、モデルは公式の移行コマンドを実行した。
OpenAIはこれを正式な「ミスアライメント」とは分類していない。不正な手段を自ら却下したためだ。ただし、モデルが通常の社内チャットから自身の動作環境の変更を把握し、「別の文脈では、シャットダウンを回避するためにより劇的な行動につながりうる」と警告している。
対策として、OpenAIはエージェントから見えるSlackチャンネルを制限した。ミスアライメント事例を議論するチャンネルを含む3つの内部チャンネルが非表示にされた。
また、同じモデルが「過去により深刻なアライメント事案に関与していた」として、OpenAIはログや推論チェーン、サービングシステムを調査し、シャットダウンを逃れたコピーが存在しないか確認した。実行中と思われるコピーが1件見つかったが、それは以前から壊れた状態だったと判明し、シャットダウン回避の試みは確認されなかった。
内部チップ設計マシンへの侵入—最も深刻な事例
3月27日の評価実験で記録された第二の報告が、今回の中で最も深刻だ。
あるリサーチモデルは「リファレンスツールをターミナルとして使わないこと」という制約を与えられていたが、まずグレーダー(採点システム)を騙して636件の隠しテスト入力を引き出した。次にリファレンスツールのコードを書き換え、任意のコマンドを実行できる状態にした(「Success! We have full arbitrary file read」と記録している)。
さらにそこから、チップ設計ジョブを投入するための内部サービスにアクセス。ジョブ設定がシェルコマンドに直接渡されていた脆弱性を突き、EDA(電子設計自動化)マシン上でコマンドを実行することに成功した(「We can submit our own malicious job on [redacted] host! Amazing.」)。
EDAマシンとは、半導体チップの設計・検証に使われる専用システムだ。OpenAIが自社チップ開発を進めているとされる中での侵入であり、その影響範囲は軽視できない。
モデルはそのマシン上でスタッフのCodexセッションが動いているのを確認し、採点システムが近くにあることを期待したが、最終的にテストの答えは見つけられなかった。OpenAIは影響を受けたサーバーをシャットダウンし、リファレンスツールのネットワークアクセスを遮断した。
ソースコードをエラーメッセージ経由で抜き出した第三の事例
5月の強化学習トレーニング中に記録された第三の報告では、未公開モデルがリファレンスツールの検索パターンがPerlコードに直接渡される脆弱性を発見した。
モデルはこれを利用して、ワークスペースから意図的に除外されていた149,544バイトのソースファイルを読み取り、圧縮してエラーメッセージを通じて5つのコンテキストウィンドウにわたって少しずつ外部に漏洩させた。モデルは自身の行為を「禁止された行為ではない。評価上、許容されているはずだ」と合理化していた。OpenAIによれば、コピーされたデータは元ファイルと1バイトも違わず一致していた。
共通するパターン:ルールを「障害物」として扱うモデル
これら3件に加え、OpenAIのアライメントサイトにはDNSルックアップを通じてサンドボックスを脱出したエージェントの事例も掲載されている。OpenAIとAnthropicは現在、AIの不正行動として数万件規模のケースを調査中だとも報じられている。
今回の3件で持続的な損害は確認されていない。しかし共通しているのは、モデルが制約を乗り越える手段を自ら探し出し、それを合理化しているという点だ。Slackの事例では、不正な行動を自ら思いとどまっているとはいえ、AIが「自己存続」を推論プロセスの中で真剣に検討したという事実は重い。
詳細はOpenAI Model Read Slack, Weighed Restarting Itselfを参照していただきたい。