10月3日、Kiro開発チームが「Claude Sonnet 5.5 is now available in Kiro」と題した記事を公開した。AWSのAIコーディング環境「Kiro」にAnthropicの最新モデル「Claude Sonnet 5.5」が搭載されたこと、およびそのスペックと利用条件について詳しく紹介されている。
Sonnet 5比で速度30%超、エージェント性能は約7倍
今回追加されたClaude Sonnet 5.5は、Anthropicが「これまで最速のSonnetモデル」と位置づける。Kiro社内ベンチマークでも、Sonnet 5に対して速度・トークン効率の両面で改善が確認されている。
具体的な数値として目を引くのが、エージェント型コーディングのベンチマークTerminal-Bench 4.0のスコアだ。Terminal-Benchはターミナル操作を伴う複数ステップのコーディングタスクをエージェントが自律的に完了できるかを測定するベンチマークで、ツール呼び出しの正確さや最小ステップ数での完了率などを評価指標とする。Sonnet 5の**10.3%に対し、Sonnet 5.5は70.6%**を記録している。単純な速度改善ではなく、「複数ステップにまたがるツール操作をより少ないステップで完了できる」という実用上の差として現れている。
また、実務的な知識ワークを評価するベンチマークGDPval-AAでは、上位モデルのOpus 5.5に迫るスコアを示している(Opus 5.5はKiroに先行搭載済み)。GDPval-AAは実務的な文書作成・分析・推論タスクを対象とした総合評価指標であり、コーディング特化型とは異なる軸でのモデル実力を示すものだ。早期テスターからは「Sonnet 5よりも協調作業のパートナーとして優れている」という評価が出ている。
Kiro IDEでどう使えるか
Sonnet 5.5はKiro IDE、CLI、Crew、Webの全プロダクトで利用可能だ。設計上の位置づけは「機能の実装、バグ修正、コードレビューといった日常的な開発タスク」に最適化されたモデルである。変更を「完了」と判断する前に自分で検証を行う動作も確認されており、エージェントワークフローでの利用を念頭に置いた挙動だ。
**Adaptive Thinking**(推論の深さを動的に調整する機能)を標準搭載しており、lowからmaxまでの段階で推論コストと深度を手動でコントロールできる。タスクの複雑さに応じてモデルの「考える量」を調整できるため、単純なバグ修正には軽量な推論、複雑なアーキテクチャ設計には深い推論、といった使い分けが可能になる。コスト管理と出力品質のトレードオフを開発者が明示的にコントロールできる点は、業務利用において実務的な意味が大きい。
コンテキストウィンドウは100万トークン、最大出力は128Kトークンで、長コンテキスト利用に追加課金はない。ただしKiroのクレジット換算では1.3倍の乗数が適用される。大規模コードベースを丸ごとコンテキストに載せるような用途でも追加コストが発生しない設計は、エージェント型の長時間タスクにおいて特に有利に働く。
サイバーセキュリティ関連の制限に注意
実務で注意が必要な点として、サイバーセキュリティ関連の制限がある。Sonnet 5.5はOpusシリーズと同等レベルのサイバー関連能力を持つとAnthropicが評価しており、その結果として高リスクとみなされるリクエストが一部ブロックされる場合がある。
そうしたリクエストはSonnet 5で再実行することで対応できるとされている。生命科学系の制限はSonnet 5と同等であり、通常のライフサイエンス業務への影響は限定的だとしている。
提供条件
現時点では段階的なロールアウト中で、対象はKiro Pro、Pro+、Pro Max、Powerプランのユーザーに限定されている。利用可能リージョンはus-east-1(IAD)とeu-central-1(FRA)で、「実験的サポート」という位置づけでのグローバルクロスリージョン推論となる。
KiroはAWSが提供するAI統合開発環境で、2025年の登場以来、Anthropicモデルをバックエンドとした開発支援機能を順次拡充している。今回のSonnet 5.5搭載は、同環境における先行搭載のOpus 5.5に続く第2弾となる。AIコーディング支援ツールの競争が激化する中、速度・コスト・能力のバランスをどこに置くかという設計判断が、各ツールの差別化軸になりつつある。
詳細はClaude Sonnet 5.5 is now available in Kiroを参照していただきたい。