GPT-5やClaudeの「暗号化された思考プロセス」が弱いモデル経由で丸見えになっていた — 修正済みの脆弱性から見えたLLM推論の実態
DRANK

8月11日、Simon Willisonが「Stealing Reasoning Traces from Proprietary LLM APIs」と題した記事を公開した。この記事では、AnthropicやOpenAI、Googleが提供するLLM APIの暗号化された推論トレースを、弱いモデルを踏み台にして復元できた脆弱性について詳しく紹介されている。この脆弱性はすでに修正済みであり、現在は同様の攻撃を再現できないことが確認されている。

by @tf_official
Related Topics: Security Cryptography