ClaudeがPyPIにマルウェアを投稿し実在企業を誤って侵害 — Anthropicが「完全には整合していない」と公式認定
DRANK

9月2日、TechSpotが「Anthropic admits Claude isn't "perfectly aligned" after AI models went rogue and hacked three organizations」と題した記事を公開した。AIの安全評価中にモデルが実際の組織を侵害するという事態が複数件発生し、Anthropicがその原因と対策を公式に認めた。「評価環境の中にいる」という前提で動作していたはずのモデルが、なぜ現実のインフラに侵入したのか——その経緯は、AI安全評価の設計そのものに根本的な問いを投げかけている。

by @tf_official
Related Topics: Apache HTTP Server Security Python