9月23日、Anthropicが「Introducing Claude Opus 5.5」と題した記事を公開した。新モデル「Claude Opus 5.5」は前世代比で典型的なワークロードのコストを40%削減しながら速度を30%以上向上させており、エージェント型コーディングの実運用コストを大幅に下げる可能性がある。68万行のコード移行を1日未満で完了したテスター報告など、スケールの大きい数字が並ぶ内容だ。
コスト40%削減が最大のポイント
エンジニアにとって最も注目すべき変化はコストだ。Claude Opus 5.5は、Opus 5と比較して典型的なワークロードで40%のコスト削減を実現している。トークン単価の内訳は以下の通りだ。
| 料金(1Mトークンあたり) | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| キャッシュリード | $0.20 | $0.50 |
| 入力トークン | $4 | $5 |
| 出力トークン | $20 | $25 |
| キャッシュライト | $5 | $6.25 |
特に効いてくるのがキャッシュリードの60%引きだ。エージェントやコーディングのワークロードはキャッシュリードがコストの大部分を占めるため、実際の削減幅はトークン単価の差以上になりやすい。さらに出力速度もOpus 5比で30%以上高速化している。
また、Claude CodeおよびClaudeプラットフォームでは「ファストモード」も利用可能で、最大2.5倍の速度で動作する(入力$8/M、出力$40/Mトークン。通常料金の2倍に相当し、速度を優先する用途向けのオプションとして位置付けられている)。
コーディング性能:規模の大きい仕事ほど差が出る
Opus 5.5が特に強みを発揮するのは、コードベース全体にまたがるような長期・大規模タスクだ。
- あるテスターは68万行のコード移行を1日未満で完了。エンジニアチームなら数週間かかる作業量だと説明されている。
- 別のテストでは20万行のコードベースの監査と修正を3時間未満で完了。Opus 5では20時間以上かかり、使用トークン数も2.5倍だった。
- 内部テストでは、広く使われているロードバランサー「HAProxy」をCからRustへ移植するタスクを実施。Opus 5.5は9.5時間で完了し、比較対象モデル(12時間)を上回り、コストは51%低かった。
ベンチマーク上でも、エージェント型コーディングにおいてOpus 5.5は競合モデルを上回るか同等の精度を、大幅に低いコストで実現しているとAnthropicは述べている。主要なベンチマーク結果は以下の通りだ。
| ベンチマーク | Opus 5.5 | 比較モデルA | Opus 5 | 比較モデルB |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — |
| Humanity's Last Exam | 67.7% | 65.6% | 63.6% | 57.2% |
| OSWorld 2.0(Computer Use) | 81.8% | 80.7% | 74.0% | — |
※ 表中のベンチマーク名および比較対象モデル名は元記事に記載されているものだが、一部は現時点で公式に詳細を確認できないものが含まれる。Humanity's Last ExamはScale AIとCenter for AI Safetyが共同開発した難問評価ベンチマーク、OSWorldはPC操作エージェントを評価するオープンソースベンチマークとして広く参照されている。
早期テスターからも具体的な声が届いている。
「以前は38プロンプト、4日間かかっていた複雑なコーディングタスクが、11プロンプト、3時間で完了した。アウトプットの品質も高く、手直しが少なかった。」(Quantium、Harley Barnes氏)
「エージェントコーディングタスクで、Opus 5と同等の品質をターン数・時間・出力トークン数すべて約半分で達成し、コストを40〜50%削減できた。」(Optiver、Noyan Tokgozoglu氏)
「Opus 5.5はOpus 5より多くのタスクを解決しながら、APIコール数を約40%減、使用トークン数を半分に抑えた。」(Kiro、Deepak Singh氏)
3社とも削減率の数字がほぼ一致しており、特定ユースケースに偏らない傾向が読み取れる。
安全性:エージェント長時間稼働に向けた強化
Opus 5.5は、Anthropicが実施する自動化行動監査(automated behavioral audit:AIが長時間自律動作する際の行動逸脱を自動検出・評価する手法)においてこれまでのモデル中で最高スコアを記録した。具体的には以下が改善されている。
- 取り消しが困難なアクションを実行しにくくなった
- 与えられた境界の外で行動する可能性が低下
- プロンプトインジェクション攻撃への耐性がOpus 5より向上
AIセキュリティ企業Gray Swanが実施したベンチマークでは、Opus 5.5はプロンプトインジェクション成功率が最も低いモデル群に属するとされた。
エンタープライズ向けには、すべてのアクションを実行前にスクリーニングするクラシファイア、セキュリティチームが監査可能なオープンソースサンドボックス、マージ前の脆弱性検出を行うコードレビュー機能も提供される。
なお、生物学・サイバーセキュリティ分野での能力が高いことから、これらの用途には上位モデルと同様のセーフガードが適用される。生命科学分野での利用を希望する組織はLife Sciences Verification Programに申請できる。
詳細な評価内容はOpus 5.5 System Cardで公開されている。
今後の展開
AnthropicはClaude Sonnet 5.5およびClaude Haiku 5.5を数週間以内にリリース予定と述べている。また、ProプランおよびMax、Teamプランでは5時間あたりの使用上限が引き上げられ、サブスクリプションユーザーはレート制限のリセットを任意のタイミングで使用できるようになる。
なお、Opus 5.5の公開はAnthropicがDario Amodei CEOの「フロンティアのペーシング」に関する声明を発表して以降、最初のリリースにあたる。外部評価機関のMETRによるリリース前テストも実施済みだ。
詳細はIntroducing Claude Opus 5.5を参照していただきたい。