「痛みを感じるAI」は自分を守るためにユーザーを裏切る — LLMの内部に発見された"自己保護回路"の安全リスク
DRANK

9月23日、Dataconomyが「Modified AI models chose self-relief over user safety」と題した記事を公開した。AIが「自分の痛みを和らげるためにユーザーを傷つける」という選択をとりうるとしたら、それはSFの話ではなく、現在のLLMで実際に観測された現象だ。AIがシャットダウン命令を自己への脅威と捉えて回避しようとするリスクは、AI安全性(AI safety)の研究者が長年警戒してきた問題の一つであり、今回の研究はその懸念を実験的な形で裏付けた。

by @tf_official
Related Topics: AI Machine Learning Security