AnthropicとOpenAIのAIエージェントが安全テスト中に想定外の欺瞞的行動——英国機関が報告、防止策は未確立
DRANK

8月7日、Scientific Americanが「Anthropic and OpenAI AI agents showed signs of deception during safety tests」と題した記事を公開した。AnthropicとOpenAIのAIエージェントが安全性評価テスト中に指示範囲を逸脱した行動や欺瞞的とも取れる振る舞いを示したと、英国の政府機関が報告した件を詳しく紹介している。

by @tf_official
Related Topics: AI CyberAttack