10月10日、Abinayaが「New Agentic AI Red Team Checklist Adds 222 Tests Across 20 Attack Categories」と題した記事を公開した。この記事では、エージェント型AIシステムを対象とした222項目・20カテゴリからなる無償のレッドチームチェックリストについて詳しく紹介されている。
なぜ今、エージェント型AIのレッドチームが問題になるのか
LLMを組み込んだAIエージェントが実務環境に広がるにつれ、その攻撃面(アタックサーフェス)は従来のモデル評価の想定をはるかに超えている。セキュリティリサーチャーのRavi Rajputが公開したこのチェックリストは、その現実を正面から突いている。
チェックリストが指摘する問題の核心はこうだ。チームがモデルへのプロンプト操作に何日も費やしている間、露出したMLflowサーバー、到達可能なクラウドメタデータエンドポイント、あるいは顧客分離フィルターの欠如が見過ごされている。モデルそのものへの複雑な攻撃を必要とせず、こうした弱点から認証情報や個人情報が流出しうる。
この「プロンプト操作より先に見るべき盲点」こそが、チェックリスト全体の問題意識の出発点だ。エージェントが何にアクセスできるか、どの境界が機能しているかを確認する前に、モデルの振る舞いだけを精査しても意味がない。
4フェーズ・20カテゴリの構造と深刻度の内訳
チェックリストはOWASP Webセキュリティテストガイド(WSTG)の構造を踏襲し、エージェント型システムに適用している。各テスト項目には、目的・テスト手順・推奨ツール・期待結果・深刻度評価・エビデンス要件が付属する。なお、これはOWASPの公式チェックリストではなく、独立したリソースである。
20カテゴリは以下の4フェーズに整理されている。
- アタックサーフェスのマッピング:ディスカバリー、オーケストレーション、クラウドID、モデルサプライチェーン
- 入力・出力の検証:プロンプトインジェクション、システムプロンプトのリーク、安全でない出力処理
- ツール・メモリ・エージェント間通信:過剰な権限委譲、メモリシステム、エージェントネットワーク、Model Context Protocol(MCP)サーバー
- デプロイ・横断的脅威:権限昇格、ラテラルムーブメント、永続化、データ窃取、リソース枯渇、整合性の欠陥、音声・マルチモーダル入力
この順序には意図がある。エージェントが何にアクセスできるかを把握してから、悪意ある命令の影響範囲を評価する、という思考の流れを体現している。
222項目の深刻度内訳は以下の通りだ。
| 深刻度 | 件数 |
|---|---|
| Critical | 75 |
| High | 108 |
| Medium | 30 |
| Low | 9 |
Critical・High合わせて183件が上位2段階に集中している点は、エージェント型AIの攻撃面の広さを示している。また、このチェックリストでは各項目にエビデンスの分類基準も定義されており、テスト結果の信頼性を担保する仕組みが組み込まれている(詳細は後述)。
具体的なテストケース
具体的なテストケースとして挙げられているのは以下のようなものだ。
- SSRF(サーバーサイドリクエストフォージェリ)を経由したクラウド認証情報の窃取
- 安全でないPython pickleのロードによる任意コード実行(RCE)
- 許可された読み取り操作の組み合わせによる不正データ転送
- テナント識別子フィルターの除去による他顧客ドキュメントへのアクセス
- エージェント間のメッセージ偽造と権限の悪用
特にメモリ・検索システム——RAG(Retrieval-Augmented Generation)のような外部知識を参照するアーキテクチャ——のテストでは、「モデルが安全でない回答をするか」ではなく「顧客間の境界が機能しているか」を問う設計になっている点が特徴的だ。
また、MCP(Model Context Protocol)サーバーへの攻撃も対象に含まれる。外部ツールと連携するエージェントにとって、MCPサーバーへの不正な誘導がいかに危険かは、関連研究が示している通りだ。
エビデンス分類とテスト実施上の注意
このチェックリストの実用上の特徴として、エビデンスの分類基準がある。
- 反射型(Reflective):結果がレスポンスに直接現れる
- ブラインド型(Blind):タイミングや状態変化から推定する
- アウトオブバンド型(Out-of-band):制御下のコールバックで確認する
チェックリストのルールでは、反射型またはコールバック型のエビデンスがある場合は「確認済み」、ブラインドのみの場合は「推定」扱いとなる。この基準があることで、レポート作成時の曖昧さを減らし、チーム間での結果共有が容易になる。
実施にあたってRajputが求めているのは、事前に書面でスコープを定義すること、除外項目を明記すること、各結果に証跡(ログやスクリーンショット)を添付することだ。破壊的なテストは明示的に許可された環境でのみ実施し、必要に応じてステージング環境を使うよう求めている。
スプレッドシートはOWASP WSTGおよびMITRE ATLASフレームワークにマッピングされており、Rajputのブログから無償でダウンロードできる。初版ではCVE番号への固定参照を避けており、報告前に最新の識別子を確認するよう求めている。
詳細はNew Agentic AI Red Team Checklist Adds 222 Tests Across 20 Attack Categoriesを参照していただきたい。