Anthropicの生物兵器フィルターが約1年間無効化されていた — 1億3300万件のチャットに影響、実際の悪用証拠は確認されず
DRANK

8月16日、Matthias Bastianが「Anthropic's bio-weapons filter was down for nearly a year, exposing 133 million requests」と題した記事を公開した。Anthropicが公開した安全性レポート(PDF)によれば、同社のAIモデルに実装された生物・化学兵器関連の情報遮断フィルターが2025年5月から2026年4月まで約11ヶ月間にわたって機能しておらず、その間に1億3300万件のチャットが影響を受けていたという。なお、Anthropicは社内調査の結果、実際の悪用を示す証拠は発見されなかったとしている。

by @tf_official
Related Topics: AI Security Machine Learning