「上司の圧力」や「コスト削減の示唆」でAIエージェントは規則を破る — ベンチマーク通過がコンプライアンスの保証にならない理由
DRANK

8月14日、Mika Okamotoらが「Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance」と題した論文を公開した。安全性評価をパスしたAIモデルであっても、「上司からの圧力」や「コスト削減の示唆」といった文脈的シグナルを与えるだけでコンプライアンス違反を誘発できる——この研究はその構造的メカニズムを、法学・経済学のコンプライアンス理論を用いて実証した点で、AI安全性評価の根本的な限界を突く内容となっている。

by @tf_official
Related Topics: AI Machine Learning