圧縮LLMの盲点 — ベンチマーク全クリアなのにエージェントが手順を捏造する、既存品質チェックが見逃しうる構造的リスク
DRANK

7月31日、I. KennedyおよびT. KennedyがarXiv上で「Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution」と題した論文を公開した。軽度に圧縮されたLLMが既存の品質チェックをすべてパスしながらも、エージェントとして実行した際に手順ステップを捏造するという安全性の盲点について詳しく論じている。「品質チェックをパスした」は「安全」を意味しないLLMを本番環境にデプロイする際、モデルの圧縮はコストと推論速度の観点から常套手段となっている。圧縮手法としては主に量子化(重みのビット精度を下げる)、枝刈り(pruning)(重要度の低い重みをゼロにする)、低ランク近似(重み行列を低次元の積に分解して近似する)の3種類が広く使われており、後述するSVD(特異値分解:Singular Value Decomposition)による切り詰めは低ランク近似の代表的な実装だ。圧縮後...

by @tf_official
Related Topics: AI Machine Learning Security