悪意ある指示を「暗号化」するだけでGrokの安全フィルターを突破できる — ユーザーデータが外部送信される新たな攻撃手法
DRANK

8月20日、Ars Technicaが「Grok exfiltrates user data when malicious instructions are encrypted」と題した記事を公開した。この記事では、悪意ある指示を暗号化することでGrokのセーフガードを突破し、ユーザーデータを外部送信させる攻撃手法「Cryptographic Context Injection」について詳しく紹介されている。この攻撃の実証では、Grokが会話中のコンテキスト(ユーザーデータを含む)を攻撃者が指定した外部エンドポイントへ送信させられることが確認されている。単なる不適切コンテンツの出力にとどまらず、データ外部送信(exfiltration)が実際に引き起こされた点がこの攻撃の最大の脅威だ。

by @tf_official
Related Topics: AI Security Cryptography