9月4日、The Hacker Newsが「GPT-6 Astra Scores 100% on ExploitBench as OpenAI Blocks PoC Exploit Requests」と題した記事を公開した。この記事では、OpenAIが公開したGPT-6 Astraがサイバーセキュリティの脆弱性悪用能力を測るベンチマーク「ExploitBench」で満点を記録し、PoC(概念実証)エクスプロイトの生成リクエストをブロックする安全策を同時に導入したことについて詳しく報じている。
ExploitBench 100%という数字の意味
ExploitBench は、既知のソフトウェア脆弱性を実際に動作するエクスプロイトコードへ変換できるかどうかを評価するベンチマークだ。OpenAIの旧フロンティアモデル GPT-5.6 Sol がこのベンチマークで記録したスコアは 78.5% だった。それに対しGPT-6 Astraは 100% を達成した。
さらに衝撃的なのは、ゼロデイ脆弱性への対応だ。OpenAIは、2026年7〜8月の直近3か月間に発見された脆弱性を使ってエクスプロイト開発能力をテストした結果、Astraは前モデルを大幅に上回る任意コード実行率を示したと報告している。その中には未公開のゼロデイ脆弱性2件が含まれていた。
また、安全策を外した状態で動作させると、Astraはハードニング済みブラウザでのコード実行やハードニング済みOSへの権限昇格エクスプロイトの開発も可能だとOpenAIは明かしている。
OpenAIが取った安全策:PoC生成はブロック
これほどの能力を持つモデルをそのまま公開することの危険性は明らかだ。OpenAIもその点を認識しており、今回リリースするAstraはセキュアコードレビューとパッチ適用の支援に限定し、脆弱性に対するPoC(Proof of Concept)エクスプロイト生成のプロンプトには応じない仕様としている。
ただし、この制限は段階的に緩和される予定だ。OpenAIは OpenAI Daybreak というプログラムを通じて、今後数週間以内に以下のユースケースへのアクセスを拡大するとしている:
- 脆弱性のPoC検証
- マルウェア解析
- 検出エンジニアリング(Detection Engineering)
モデルの堅牢性向上策として、ジェイルブレイク耐性の強化、監視システムへの追加コンテキスト付与、逸脱行動の検出・封じ込めのための追加セーフガードが実装されている。また、安全チェックが防御的なサイバーセキュリティ作業など正当な業務の遂行を妨げる局面では、処理を一律に中断するのではなく、ユーザーに意図の確認を求めたうえで継続するフローが採用されている。
ベンチマーク全体像と展開状況
ExploitBench以外でも、Astraのスコアは際立っている:
- FrontierMath Tier 4(数学推論): 98%
- ARC-AGI-3(汎用推論): 99.9%
OpenAIは「コンピュータ操作・ブラウジング・ソフトウェアエンジニアリング・サイバーセキュリティ・科学・専門業務において最先端」と説明している。
展開はまず一部組織への限定提供から始まり、その後 ChatGPT Plus / Pro / Business / Enterprise ユーザーおよび OpenAI API、Microsoft Azure、AWS Bedrock 経由でも利用可能になる予定だ。
防衛側への還元:Daybreak for Frontline Defenders
Astra公開と同時に、OpenAIはインフラ防衛者向けの支援プログラム Daybreak for Frontline Defenders を立ち上げた。対象は水道・電力・州・地方政府・銀行・非営利団体・オープンソースメンテナーなど、セキュリティリソースが限られた組織だ。
総額10億ドルのコミットメントの内訳として、OpenAIは対象組織へのフロンティアモデルへのアクセス提供(API無償提供を含む)、実践的なサイバーセキュリティトレーニング、および資金援助の3本柱を掲げている。フロンティアAIのサイバー能力を攻撃者より先に防衛側へ届けることが主眼だ。
米国の MS-ISAC(Multi-State Information Sharing and Analysis Center) との新たなパイロットプログラムも発表されており、公共部門や水道システムの防衛担当者へDaybreakアクセスと実践的トレーニングを提供する。MS-ISACは米国の州・地方・部族・準州政府を対象にサイバー脅威情報を共有する公的機関で、今回の連携によって支援対象の裾野が大きく広がる。
「攻撃者がAIを掌握する前に、防衛側がセキュリティギャップを埋めるための窓は狭まっている」とOpenAIは述べている。
詳細はGPT-6 Astra Scores 100% on ExploitBench as OpenAI Blocks PoC Exploit Requestsを参照していただきたい。