10月1日、Tech Startups が「Google launches Gemini 4 Argon, its most advanced AI model yet」と題した記事を公開した。Googleが新フロンティアモデル「Gemini 4 Argon」を発表し、データセンターで300 TiB超のメモリを自律的に解放、セキュリティ脆弱性修正ベンチマーク「CWE-bench v1」で68%を記録して首位タイ、コーディングベンチマーク「DeepSWE v1.1」で77.9%の最高スコアを更新するなど、実務環境での動作を裏付ける数字を次々と打ち出した。
コーディングとサイバーセキュリティに特化したGoogleの最新モデル
GoogleはGemini 4 Argonを発表した。既存の全Geminiモデルを上回るとされるフロンティアモデルで、コード生成・セキュリティ脆弱性の自動修正・長期的な業務ワークフローの実行を主要ターゲットに据える。
Alphabet CEO Sundar Pichai はXで次のようにコメントした。
"Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback."
注目すべきは通常のパブリックローンチをとらない点だ。当初はGoogle独自のFairwindプログラム(高度なセキュリティ審査を受けた政府機関・防衛関連パートナーへの限定提供枠組み)を通じたサイバーディフェンダー向けに先行提供され、より広い公開は米政府との事前評価と追加の安全性テストを経た後に行われる予定だ。
サイバーセキュリティ:脆弱性の発見から修正まで自律実行
Argonが最も強みを発揮するのがサイバーセキュリティ領域だ。モデルは脆弱性の探索・検証・パッチ生成を自律的に実行する。セキュリティ欠陥修正を測定するベンチマーク「CWE-bench v1」では**68%**のスコアを記録し、首位タイとなった。元記事では首位タイとなった他モデルの名称は明示されていないが、同ベンチマーク自体はリアルワールドのCWE(共通脆弱性タイプ一覧)に基づく修正能力を定量評価するものであり、68%という数字はその難易度を考慮すると実用水準として注目に値する。
Google Geminiモデルプロダクトリードの Tulsee Doshi はCNBCに対してこう述べている。
"We really believe that a model of this caliber and this level of frontier performance is meaningfully important for defenders."
段階的リリースの背景には、攻撃者よりも先に防御側の研究者がモデルを実際のシステムで検証する機会を与えたいというGoogleの意図がある。
ソフトウェアエンジニアリング:DeepSWEで最高スコアを更新

コーディング分野でも顕著な結果が出ている。長期・実世界のソフトウェアエンジニアリングタスクを測定するDeepSWE v1.1では**77.9%**を記録し、新たな最高スコアを更新した。
Google社内では既にArgonを以下の用途に活用しているという。
- デバッグ
- 大規模コードベースの移行(C/C++からRustへの移行を含む)
- アルゴリズム設計
さらに、C/C++からRustへの移行については、型安全性やメモリ安全性を確保しながら大規模コードベースを書き換えるという高難度のタスクをArgonが担っており、単なるコード補完にとどまらない長期エージェント的な動作が実務に持ち込まれていることを示す事例といえる。
AIが経済的に重要な業務(金融・コーディング・法律・税務)をどれだけこなせるかを測るVals Indexで1位を獲得。ZapierのAutomationBench(エンドツーエンドのビジネスワークフロー)でも**51.3%**を記録した。
Google自社インフラへの実適用:300 TiBのメモリ解放

単なるベンチマーク結果にとどまらない事例もある。Google社内では、複数のArgonエージェントがデータセンターのテレメトリ(稼働状況データ)を分析し、メモリ最適化を特定。導入後に300 TiB超のメモリを解放した。Googleはこの取り組みが最終的に500 TiB〜1 PiBのメモリ容量削減につながる可能性があると見積もっている。
AI各社がコンピュート需要に対応するためサーバーやチップへの投資を急拡大させている状況で、インフラコストの削減は現実的な価値を持つ。複数エージェントが協調してテレメトリ分析から最適化の実施まで一連のループを自律的に回したという点は、「回答を生成するAI」から「インフラを操作するAI」への移行を示す具体例として際立っている。
量子コンピューティング研究チームでもArgonを活用。公開済みのアルゴリズムのベースラインを数分で40%改善したという事例も報告されている。研究者が手作業で試行錯誤すれば数週間を要するような探索を、Argonが短時間で実行したことになり、科学的発見の加速という観点でも注目される。
100万トークン出力対応とAPI価格

Argonは最大100万トークンの出力をサポートする。従来システムの64,000トークンから大幅に拡張されており、1回の実行で長い推論・実行シーケンスを継続できる。この出力長の拡大は、コードベース移行やインフラ最適化のような長期タスクをエージェントが中断なく処理するうえで直接的に効いてくる仕様だ。
API価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで開始し、後に4ドル・20ドルへ引き上げる計画だ。
LLMレースの焦点は「実行できるか」へ
今回の発表はGoogleとOpenAI、Anthropic、xAIといったフロンティアラボの競争が「最も良い回答を生成するか」から「実際のインフラ上で信頼して動かせるか」に移行していることを示している。Argonの段階的リリースと安全性評価の枠組みは、その問いに対するGoogleなりの答えと見ることができる。
詳細はGoogle launches Gemini 4 Argon, its most advanced AI model yetを参照していただきたい。