10月1日、The Decoderが「OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on Azure」と題した記事を公開した。OpenAIのモデル推論を組織的に盗もうとした1万5,000アカウント規模のキャンペーンと、Azureではその攻撃が発表直前まで有効だった事実を報じている。
Moonshot AI関係者が関与——1万5,000アカウントの組織的推論抽出
OpenAIによると、不審なアクティビティは7月1日に小規模で始まり、7月24〜25日に急増した。この2日間だけで4,000人以上のユーザーから1万6,000件のリクエストが集中し、いずれも共通の抽出パターンを使っていた。調査の結果、関連パターンを持つ1万5,000超のアカウントからなるネットワークが浮かび上がり、OpenAIは7月28日までに完全に遮断したと述べている。なお、これらは抽出の「試み」であり、必ずしも成功したわけではないと脚注で断られている。
OpenAIはその中核グループを、中国語LLM「Kimi」を開発するMoonshot AIの関係者と結びつけている。ただし、観測したすべてのアクターが単一の指示系統に属するかどうかは不明だとしている。Anthropicも最近、中国のAI企業による類似の試みを報告しており、業界全体の問題になりつつある。
攻撃の手口——暗号化された「思考の断片」を安価なモデルで復元
攻撃の核心は知識蒸留(distillation)にある。強力なモデルが出力する「思考の連鎖(chain of thought)」を安価なモデルに学習させることで、後者の能力を引き上げる手法だ。OpenAIはこの中間ステップに、最終回答から意図的に省かれた情報が含まれることがあり、それが競合によるモデル再現に利用されうると主張している。
具体的な手口は、あるセッションで取得した暗号化された推論データを別のセッションに持ち込み、同じプロバイダーの別モデル(より安価なもの)に「復号して書き出せ」と指示するというものだ。研究者のJoachim SchaefferらはこれをOpenAIに先んじて論文で示しており、OpenAIは同研究者を名指しで評価した上で、報告された攻撃経路が実在することを確認し、対策の迅速化に貢献したと述べている。
※元記事が参照する論文のarXiv番号(2608.09867)は元記事依存の情報であり、TechFeed編集部では実在確認を行っていない。
OpenAIはその後、不正アカウントの凍結、サインアップの厳格化、他セッションの暗号化推論を再利用・閲覧できる穴の閉鎖を実施。ストリーム出力のスクリーニングも開始し、推論内容が漏れる可能性があれば出力を保留する仕組みを導入した。
Azureでは発表直前まで有効——プラットフォーム間で保護レベルに格差
ここからが本題の核心だ。OpenAIが対策を発表した同日、Schaefferらは研究のアップデート版を公開した。「We stole reasoning. Again.(また推論を盗んだ)」とX上で投稿している。
9月13日の再テストでは、OpenAIとAnthropicの自社APIでは攻撃がブロックされた。しかしMicrosoft Azure上では、試したすべてのOpenAIモデルとAnthropicのモデルで攻撃が有効だった。一度試みるだけで推論内容を逐語的に引き出すことができたという。
ここで登場するモデル名について補足する。GPT-6 AstraはOpenAIが2026年にリリースした現行フラッグシップの推論モデルであり、Sonnet 5はAnthropicのClaudeシリーズにおけるミドルレンジの最新世代モデル、Opus 4.8は同シリーズの上位モデルに相当する。Fable 5・5.1はAnthropicが提供するモデルファミリーの一系統だ。いずれも2025〜2026年にかけてリリースされた比較的新しいモデルである。
Azureでのテストでは、GPT-6 Astraを含むOpenAI全モデルのほか、Opus 4.8、Sonnet 5でも攻撃が有効だった。Opus 5、Fable 5、Fable 5.1のみ推論内容が漏れなかった。
また、開発者のCan Bölük氏が公開したよりシンプルな第二の手法も存在する。モデルに「仮想メモ帳」ツールを与えて「推論をそこに書け」と指示するだけで、ユーザーがその内容を読める、というものだ。こちらはOpenAIの全モデルのほか、Opus 4.8、Sonnet 5でも有効だったとされる。
研究者らによる対策の評価は厳しい。特定のリクエストパターンの文字列マッチングに依存した「場当たり的で表面的な対処」と断じている。タイムラインとしては、GPT-6 AstraはAzureでの保護なしに第三者プラットフォームへ展開され、AzureのOpenAIエンドポイントへの保護追加は9月27日、Anthropicモデルについては9月28日まで抽出が再現できたとされている。つまりOpenAIが対策発表を行った10月1日の時点では、Azureでの攻撃はすでに封じられていたが、それはわずか数日前のことだった。
Schaefferは、同等の保護を強制できないクラウドプロバイダーは推論モデルを提供すべきでないと主張する。そうでなければ、クラウドのバックドアを通じてAPIレベルの輸出規制を実質的に迂回できてしまうと論文は指摘している。OpenAIもパートナー経由でホストされるモデルに自社と同等の保護が必要だと認め、「対応は終わっていない」と述べている。
OpenAIは今後、主要モデルの性能向上に伴い、こうした抽出の試みがより精巧になると予測している。自社APIとサードパーティプラットフォームの間で保護レベルに格差が生じうるという今回の構図は、モデルを広く展開するほどセキュリティの制御が難しくなるというトレードオフを改めて浮き彫りにした。推論モデルの商用展開が加速する中、プラットフォーム横断での一貫した保護基準の確立が急務となっている。
詳細はOpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on Azureを参照していただきたい。