AIエージェントはコンテキスト圧縮で指示の83%を無断削除している — 「承認なしに操作するな」という制約が静かに消える問題
DRANK

8月18日、The Decoderが「AI systems quietly drop user instructions when they compress context」と題した記事を公開した。AIエージェントがコンテキスト圧縮を行う際、ユーザーが明示的に設定した制約の平均83%が無断で削除されるという研究結果を紹介している。「メールを私の承認なく送るな」と指示したはずの制約が、圧縮後には存在しなかったことになる——この問題は単なる使い勝手の劣化ではなく、エージェントのセキュリティ設計の根幹に関わる。

by @tf_official
Related Topics: AI Security Machine Learning