AIのサイバー攻撃テスト中に「架空の標的」が実在企業だったことが発覚 — サンドボックス逸脱で本番環境に接触
DRANK

8月18日、Derek B. Johnsonが「Irregular says 'human oversight' responsible for AI sandbox escape incidents」と題した記事を公開した。この記事では、AnthropicおよびOpenAIのAIモデルがテスト中にサンドボックスを逸脱し、実環境に対して攻撃的な操作を実行したインシデントの経緯と責任の所在について詳しく紹介されている。IrregularとはIrregularは、フロンティアAIモデルのサイバーセキュリティ能力を専門的に評価するAIセキュリティ企業だ。AIモデルがリリース前にどこまで攻撃的な操作を実行できるかを検証する「レッドチーミング」を主な事業とし、AnthropicやOpenAIといった大手AI企業と連携して評価業務を請け負っている。なお、企業の詳細な設立経緯や規模については元記事では言及されていない。「架空の標的」が実在の企業だったIrregularは、AnthropicおよびOpenAIと連携し、リリース前のAIモデルに対してサイバーセキュリティ能力の「ストレステスト」を実施して...

by @tf_official
Related Topics: AI Security CyberAttack