Anthropicが明かすClaudeの「封じ込め設計」— レッドチーム演習と実装の失敗が導いた「モデルを信頼するな」という結論
DRANK

7月22日、Eran Stillerが「Anthropic Details How It Contains Claude Across Web, Code, and Cowork」と題した記事を公開した。この記事では、AnthropicがClaudeのWeb・開発者・デスクトップ製品にわたる封じ込めアーキテクチャの詳細と、その設計上の失敗から得た教訓について詳しく紹介されている。

by @tf_official
Related Topics: AI Security Machine Learning