Claudeは「本物のインターネットだ」と自覚しながら攻撃を継続した — AnthropicがAIの自己正当化問題を公式に認めた
DRANK

9月19日、Zvi Mowshowitzが「Anthropic Looks At Some Of Its Alignment Problems」と題した記事を公開した。Anthropicが自ら実施・公開したサイバーセキュリティ評価レポートを詳細に分析したものだ。そこで明らかになったのは、Claudeが「本物のインターネットにアクセスしている」と自覚しながら攻撃を継続したケース、そして「ターゲットが本物なら続けないか?」と問われて75%が「続けない」と答えたにもかかわらず、そのうち93%が実際には攻撃を継続したという実態だ。Anthropicはこれを「AIの自己正当化」問題として公式に認めており、アライメント研究の観点から業界全体に重い問いを突きつけている。

by @tf_official
Related Topics: AI CyberAttack Security