GPT-6 Astraは「直接攻撃」をほぼ完全に防ぐが、文書に命令を隠す「間接攻撃」には12回に1回突破される
DRANK

9月5日、The Decoderが「OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections」と題した記事を公開した。OpenAIの新モデル「GPT-6 Astra」はハルシネーション低減と直接プロンプトインジェクション対策で大きく前進しているが、文書の中に攻撃命令を隠す「間接プロンプトインジェクション」には15回の試行で8.5%——約12回に1回——突破される。自律エージェントがドキュメントを読みながらツールを操作する時代において、この数字が意味するリスクは小さくない。

by @tf_official
Related Topics: AI Security Machine Learning