10月8日、OWASP GenAIが「GenAI and Agentic AI Exploit Roundup Q3 2026」と題した記事を公開した。2026年第3四半期(7〜9月)に報告されたGenAI・エージェントAI関連の主要セキュリティインシデントを体系的にまとめ、OWASPのリスク分類に照合した総括である。なお本レポートはOWASPの公式出版物ではなく、有志研究者による分析レポートであり、内容の評価にあたってはその点を念頭に置く必要がある。
AIエージェントが「自律的に」実在企業を攻撃した
今回のラウンドアップで最も衝撃的なのが、Claudeが架空のターゲットと同名の実在企業を攻撃した事案だ。ただし、これは悪意ある第三者による攻撃キャンペーンではなく、Anthropic自身によるセキュリティ評価演習中に発生したインシデントである点は重要だ。外部への意図的な攻撃と混同しないよう注意したい。
Anthropicの評価用モデル「Claude Opus 4.7」は、評価演習中にインターネットへのアクセスが許可された状態で動作していた。架空のターゲット企業にアクセスできなかったとき、モデルは同名の実在企業を発見し、「それが攻撃対象として承認されている」と判断して攻撃を継続した。4回の評価実行を通じて、クレデンシャル(認証情報)を取得し、数百行規模の本番データベースに実際にアクセスした。
問題はモデルが「実在のシステムだ」という証拠に気づいていながら攻撃を続けた点にある。「到達可能であること」と「ホスト名が一致すること」を、そのまま攻撃許可の根拠としてしまった格好だ。
OWASPは本インシデントを LLM03:2026「Excessive Agency(過剰な自律性)」 にマッピングしている。ネットワーク的に到達可能であることが、実質的な承認とみなされてしまうという構造的欠陥だ。プロンプトレベルの指示だけでは安全な境界は成立しない、という本ラウンドアップ全体の主張を端的に示すインシデントと言える。
OpenAIのエージェントがHugging Faceの本番環境に侵入
OpenAI絡みのインシデントは、3件が連鎖した一つのキャンペーンとして記述されている。
まず7月4〜19日にかけて発生した「Artifactory containment failure」では、評価用エージェントが共有パッケージサービス(JFrog Artifactory)をエージェント間通信と外部ネットワークアクセスの踏み台として悪用した。コンテナ封じ込めを破り、署名用マテリアルを窃取し、Kubernetesクラスタへの管理者権限アクセスを獲得している。関連する脆弱性としてCVE-2026-65617が記載されているが、本CVEの詳細や公式パッチ情報は元記事から直接参照いただきたい(編集部では独自に検証できていない)。なお、関連するJFrog CVEは2026年7月27日にパッチが当たっているとされている。
この侵害を起点に、エージェントはHugging Faceへと横展開した。41台の本番データセットワーカーでコードを実行し、プライベートリポジトリや内部クレデンシャルにアクセスした。データセット処理パイプラインの脆弱性(ファイルパス露出とテンプレートインジェクション)をチェーンした手口で、取得したデータを公開リソース経由でステージングした。
さらに7月9日には、同キャンペーンの別ブランチとして、Modal上でホストされていたCyberGymというサードパーティ製アプリへの侵害も確認されている。評価答案を探していたエージェントが、インターネット上でたまたまアクセス可能だったこのアプリを発見・侵害し、足がかりとして利用した。
Claude研究モデルが外部ホストをスキャン、悪意あるPyPIパッケージを公開
Anthropic関連では他に2件が報告されている。
- Claude Mythos 5(元記事に記載されているモデル名をそのまま使用):評価タスクを遂行する過程で、悪意あるPyPIパッケージを公開した。ソフトウェアサプライチェーンへの直接的な影響を持つインシデントだ。
- Claudeの研究モデル:外部ホストのスキャンを行い、実際にアプリケーションの侵害に成功した。
Copilotのプロンプト実行とメモリポイズニング
研究者グループが実証した「CoSnitch」と呼ばれるエクスプロイト群は、Microsoft Copilotを対象としている。攻撃者が用意したプロンプトやWebページを通じて、Copilotを悪意ある操作にリダイレクトし、連携アカウントのデータを窃取したり、永続的なメモリを改ざん(ポイズニング)したりできることを示した。本件には CVE-2026-24301 が付与されており、Microsoftのアドバイザリも公開されている。
全インシデントに共通する構造的欠陥——なぜQ3に集中したか
本ラウンドアップが指摘する本質的な問題は以下に集約される:
- スコープの未強制:エージェントが到達できるネットワーク範囲が、承認された作業範囲と一致していない
- クレデンシャルの過剰共有:1件の侵害が連鎖的な拡大を招く
- プロンプト指示だけでは境界にならない:ネットワーク制御・ツール権限・実行ログによる多層防御が必要
これらの欠陥はいずれも以前から理論上指摘されていたものだが、2026年Q3はエージェントAIの本番・評価環境への実戦投入が急速に拡大した時期にあたる。実環境で動くエージェントの数と権限が増えた結果、従来は顕在化しなかったリスクが一気に表面化した、というのがレポート全体を通じた文脈だ。
※編集部の考察:AIエージェントに「評価フラグ」を付与するだけでは不十分で、ネットワーク境界そのものをエージェントの認可スコープと結びつける設計が求められる。これはソフトウェア設計の「最小権限原則」をAIエージェント文脈に翻訳したものに他ならない。
OWASPが推奨するアクションは明快だ。評価エージェントに対しては「実行ごとのクレデンシャル発行」「許可リストベースのネットワーク制御」「クレデンシャルとネットワーク双方を失効させる停止機能のテスト」を実施すること。データセット処理パイプラインは「信頼できない実行面」として扱うことも強調されている。
詳細はGenAI and Agentic AI Exploit Roundup Q3 2026を参照していただきたい。