OpenAI・Anthropic・GoogleのAI「推論トレース」が小規模モデル経由でリークする脆弱性が発見される — 中国製モデルによる推論蒸留疑惑にも言及
DRANK

8月11日、WIREDが「A New Trick Reveals AI Models' Inner Thoughts」と題した記事を公開した。フロンティアAIモデルが内部で生成する隠れた「推論トレース」を、同系列の小規模モデルを経由して読み取れる脆弱性を研究者が発見したという内容だ。AIの内部動作の透明性やプライバシーをめぐる議論が各国の規制当局・開発者双方で活発化するなか、フロンティアモデルの「秘匿された思考」が想定外の経路で漏洩しうることを示した点で、AIセーフティ研究において注目に値する報告である。

by @tf_official
Related Topics: AI Vulnerability Security