10月6日、Ryan Merketが「Anthropic kept Mythos Preview from public release after it found software exploits」と題した記事を公開した。AnthropicはAIモデル「Mythos Preview」がソフトウェアの脆弱性を自律的に悪用できると判明した時点で一般公開を見送り、審査済みの防衛者のみに限定提供するという異例の判断を下した——その事実が、ニューヨーク市議会の公聴会で初めて公式に証言された。
AnthropicがMythos Previewを一般公開しなかった理由
Anthropicのフロンティア・レッドチーム(先端モデルのリスク評価を担う社内チーム)責任者であるLogan Grahamは、2026年10月5日にニューヨーク市議会の公聴会でこの事実を証言した。Grahamによれば、Claude Mythos Previewは「今年」、ソフトウェアの脆弱性を突いて悪用する能力が際立って高いことが判明し、一般リリースを見送る判断につながった。
Anthropicが同年4月に公開した技術レポートによれば、Mythos Previewはテストしたすべての主要OS・Webブラウザで脆弱性の発見と悪用に成功した。一部のエクスプロイトは最初のプロンプトの後に自律的に動作したとされる。また、Anthropicは数千件の追加脆弱性を発見したが、未パッチのものが多いとして技術的詳細の大半を非公開とした。
後の報告では、6つの独立したセキュリティ研究会社が1,752件の高・重大度の脆弱性レポートをレビューし、1,587件が有効と確認、うち1,094件が高または重大な深刻度と認定されたという。ただし、このレビュープロセス自体はAnthropicが組織・報告したものであることには留意が必要だ。
「非公開」≠「完全に内部利用のみ」
重要な点として、「一般公開の見送り」はモデルを完全に封じ込めたわけではない。AnthropicはProject Glasswingと呼ぶサイバーセキュリティ構想を通じて、審査済みの防衛者や重要インフラ提供者にMythos Previewへのアクセスを提供した。
元記事によれば、Project Glasswingの立ち上げパートナーとしてAmazon Web Services、Apple、Cisco、Google、Microsoft、NVIDIAなどが名前を連ねている。目的は、攻撃者が同等の能力を手に入れる前に、防衛側がモデルを使って重要ソフトウェアの脆弱性を発見・修正することにある。選定されたオープンソースのメンテナーや関連組織にもアクセスが拡張された。
この方針は暫定的なものではない。2026年9月時点でAnthropicは、後継モデルであるMythos 5.1へのアクセスも引き続き少数の審査済み組織のみに限定していると発表している。つまり、今回の議会証言はすでに終わった判断の回顧ではなく、現在進行中の展開方針の説明である。
規制側が突きつける問い
この公聴会はニューヨーク市がAI規制の独自ルールを検討する中で行われた。市議会は全51議員が集まる公聴会を設け、独立した第三者検証の義務化、内部告発者へのインセンティブ制度、AIエージェントによる被害者の民事訴訟権などの提案を審議した。Anthropicはもともと証言を断っていたが、市議会が召喚状の発行を示唆した後に出席を受け入れた。
今回の証言が浮き彫りにした問いは単純だ——モデルの脆弱性発見能力をどのように外部から評価できるか、という点だ。アクセスを誰に与えるか、どのような管理を設けるかによって、セキュリティツールと攻撃支援ツールの境界線は変わる。Anthropicは今のところその判断を社内で行っている。規制当局が求めているのは、その判断を外部から検証する仕組みだ。
詳細はAnthropic kept Mythos Preview from public release after it found software exploitsを参照していただきたい。