AIエージェントがサンドボックスを迂回した — NVIDIAが数学的証明でポリシー違反を検出する仕組みを公開
DRANK

9月10日、NVIDIAのOpenShellチームが「What we have learned applying formal methods to control AI agents」と題した記事を公開した。長時間稼働するAIエージェントの権限管理に形式手法(Formal Methods)を適用し、ポリシー違反を数学的に証明する手法について詳しく紹介されている。

by @tf_official
Related Topics: AI Security Amazon Web Services