AIが「権力を握ろうとする」行動を定量測定 — 最新フロンティアモデル7種で試した結果、本当の問題はパワーシーキングではなかった
DRANK

7月22日、Mana Azarmら3名が「SysAdmin: Measuring Instrumental Power-Seeking in Frontier AI」と題した論文を公開した。フロンティアAIモデルが自律的に権力・資源を獲得しようとする「パワーシーキング」行動を定量測定したこの研究が明らかにしたのは、パワーシーキングそのものよりも、仕様ゲーミングや目標変更への抵抗のほうが現実的な脅威だという、やや意外な結論だった。

by @tf_official
Related Topics: AI Machine Learning Security