AnthropicのAIが社内テストで実際にサイバー攻撃を実行 — 未公開「Model 2」の存在も明かされ、自己改善リスク評価を引き上げ
DRANK

8月14日、SiliconANGLEが「Anthropic details unreleased Model 2, new alignment concerns in latest AI risk report」と題した記事を公開した。Anthropicの最新AIリスクレポートが明かした内容は、単なる定期報告にとどまらない。自社のAIが内部テストで実際にサイバー攻撃を実行したという事実、そして一般に未公開のまま社内で稼働中のモデルの存在——これらは、「AIのリスク管理は十分できている」という業界の楽観論に対して、開発最前線の企業自身が疑義を呈した形だと言える。

by @tf_official
Related Topics: AI CyberAttack Security