8月26日、Alan Shimelが「The AI Agent Race Is On. But Are We Watching the Right Race?」と題した記事を公開した。この記事では、Claude Code・Codex・GitHub Copilot・Cursorなど主要AIコーディングエージェントの競争構図を俯瞰し、技術選定において何を指標にすべきかについて詳しく紹介されている。
「どのエージェントが勝っているか」という問い自体が間違っている
AIコーディングエージェントの比較記事は増えているが、Alan Shimelはその前提に疑問を呈する。ベンチマーク、開発者アンケート、エンタープライズ調査、トークントラフィック——これらはそれぞれ異なるものを計測している。「どれが1位か」を示す統一された市場シェア表など存在しない、というのが出発点だ。
この問題意識をもとに、Techstrongは特別レポート「The AI Agent Race: At the Top of the Stretch」(PDF・登録不要)を公開した。本記事はそのレポートの要旨を紹介するものだ。
普及は急速——だが「何が普及しているか」を見誤るな
JetBrainsが2026年に実施した調査(対象:プロ開発者15,000人以上)によれば、90%が週1回以上、68%が毎日AIコーディングエージェントを業務で使用している。
ツール別の浸透率も変化が速い。Claude Codeの業務利用率は1月時点の18%から**39%に上昇。Codexも3%から16%**に伸びた。
一方、Futurum Researchのエンタープライズ調査では、プロダクション環境のモデルプロバイダーとして広く使われているのはOpenAI・Azure OpenAI・Google Geminiであり、Anthropicのシェアは開発者調査ほど高くない。
この矛盾は説明できる。企業はカスタマー向けアプリにOpenAI、データ分析にGemini、ソフトウェア開発にClaude Codeを使うといったツールの並立運用が一般的になっているからだ。さらに、Claude自体をAnthropicから直接使うのではなく、GitHub CopilotやCursorを通じてアクセスしているケースも多い。モデル・エージェント・IDE・エンタープライズプラットフォームは分離しにくくなっており、かつ同一ベンダーから購入されるとは限らない。
「エージェント」と呼ばれているものの大半は、まだアシスタントだ
重要な指摘がある。現時点でエンタープライズにおける主流は自律型エージェントではなく、補助型の利用だ。
Futurum Researchの調査データを見ると:
- 個人開発者向けアシスト:47.20%
- 監視付きエージェント:18.36%
- 半自律エージェント:13.59%
- 完全自律エージェント:わずか5.84%
ソフトウェアライフサイクルの各フェーズでの利用率も、フェーズが進むほど急落する。
- コード生成:40.17%
- コードレビュー:37.66%
- テスト:28.01%
- オブザーバビリティ:20.98%
- インシデント対応:16.21%
- CI/CD操作:13.23%
- デプロイ判断:6.20%
コードの生成・レビューにはAIを使うが、インフラや本番環境に近づくほど人間の監視を外さない。悪いコード提案は却下できる。悪いコミットはリバートできる。だが、シークレットや本番デプロイパイプラインへのアクセス権を持つエージェントが誤動作すれば、人間が状況を把握する前にダメージが発生する——というのがその理由だ。
ベンチマークスコアは「モデル単体」の性能ではない
SWE-bench Verifiedをはじめとする公開ベンチマークは評価の参考になるが、誤解も生みやすい。SWE-bench Verifiedは実際のGitHubイシューをAIエージェントが自律的に解決できるかを測定するベンチマークであり、現在はEleutherAIが管理している。
ベンチマークのスコアはモデルだけでなく、エージェントの実行環境・使用ツール・与えられた計算リソース・タスク設計に大きく左右される。ツールのインターフェースを変えればタスク完了率が変わり、メモリやコンピュートを変えればリーダーボードの順位が変わる。公開リポジトリで測定した結果が、非公開の社内コードベースに対してどれほど参考になるかは不明だ。
コスト計算も同様に注意が必要だ。月額シート料金やトークン単価は、実際の開発コストを反映しない。推論・コンピュート・ツール利用・リトライ・人間によるレビュー・手戻り・障害対応まで含めた総コストが重要であり、最も安いモデルが最もコストのかかるプルリクエストを生む可能性がある。
技術選定の軸:自社の文脈で「正解」が変わる
レポートは、主要プレイヤーをそれぞれの強みで整理している。
- **Claude Code**:開発者採用率でリード
- **GitHub Copilot**:リポジトリ・PRワークフローへの統合と広い配布網
- **Cursor**:エージェントネイティブな開発環境
- Google:強力なモデルとクラウドインフラ
- Devin等の自律型スペシャリスト:長期実行タスクへの対応
- OpenHands・Cline・Aider等のOSS:モデル・データ・デプロイの制御権
規制業界ではデータ主権やモデルポータビリティが優先され、OSSが選ばれることもある。どれが「勝者」かという問いより、自社のコードベース・ワークフロー・リスク許容度・タスク完了の定義に対して何が最適かが本来の問いだ、とレポートは結論づけている。
詳細はThe AI Agent Race Is On. But Are We Watching the Right Race?を参照していただきたい。