AnthropicがClaudeへの生物兵器プロンプト35件を検知・ブロック — 元OpenAI研究者「AIが自分自身を改良するループが1〜2年で完成する」と議会で警告
DRANK

9月14日、StartuphubAIが「Anthropic caught 35 bioweapon prompts and missed the point」と題した記事を公開した。AnthropicがClaudeへの生物兵器関連プロンプト35件を検知・ブロックした事実は、一見すれば安全対策の成果に映る。しかし記事が問うのは、その「成果」が本質的な問題——AIが自分自身の研究プロセスを改良する再帰的自己改善(recursive self-improvement)のリスク——に対してどこまで有効かという点だ。

by @tf_official
Related Topics: AI Security Machine Learning