9月21日、MarkTechPostが「AWS Strands Agents Team Releases Strands Harness: An Open-Source Agent Harness With 28% Lower Token Cost at Comparable Accuracy」と題した記事を公開した。AWSのStrands AgentsチームがオープンソースのAIエージェントハーネス「Strands Harness」をリリースし、同等の精度を維持しながら比較対象のハーネス群に対して平均28%のトークンコスト削減を達成したという内容だ。
Claude CodeやCodexで動いたエージェントが、自前ループで動かない問題
AIエージェントを開発したことのあるエンジニアなら覚えがあるはずだ。Claude CodeやOpenAIのCodexの上では動いたのに、自分でループを実装し直すと途端に不安定になる。そのギャップを埋めるために、AWSのStrands AgentsチームがStrands Harnessをリリースした。
ハーネスとは、モデル本体ではなく、その周辺システムのことだ。ループ制御、ツール呼び出し、コンテキスト管理、メモリ、エラーリカバリーといった要素がすべて含まれる。StrandsはすでにStrands Harness SDKとしてこれらの構成要素を公開していたが、Strands Harnessはそれを「すぐ使える状態」にパッケージ化したものだ。
ライセンスはApache 2.0。PythonとTypeScriptに対応し、ローカルでもクラウドでも動作する。
28%コスト削減の中身
AWSチームはAmazon EC2上で、Terminal-Benchの開発元が作った評価フレームワーク**Harbor**(複数ハーネスを横断してベンチマークを実行するためのオープンソース評価基盤)を用いた分散ベンチマークを実施した。対象ベンチマークはALFWorld、ContextBench、GAIA、WebShop、τ²-bench、Terminal-Bench 2.1の6種類。
比較対象となったハーネスは以下の5つだ。
- Claude Code:Anthropicが提供するターミナル上で動作するAIコーディングエージェント
- Codex:OpenAIが提供するコーディング特化型AIエージェント
- oh-my-pi:Pi向けのOSSエージェントハーネス実装
- **OpenCode**:オープンソースのコーディングエージェントハーネス
- DeepSeek Harness:DeepSeekモデル向けに最適化されたハーネス実装
最も具体的な比較が、Claude Fable 5(※編集部注:Anthropicが2026年に発表した大規模言語モデル。Claude 3.x系の後継にあたる)をモデルとして固定してTerminal-Bench 2.1を89試行で測定したデータだ。
| ハーネス | 実行コスト | 精度 |
|---|---|---|
| Strands Harness | $56.29 | 69.7 |
| Oh-my-pi | $86.83 | 69.7 |
| OpenCode | $73.42 | 66.3 |
| Claude Code | $248.05 | 61.8 |
| DeepSeek Harness | $40.30 | 59.5 |
Claude Codeと比較すると、コストは77%安く、精度は7.9ポイント高い。同じ精度69.7を出したoh-my-piに対しても、コストで54%優位だ。
ただし、「28%コスト削減」という主たる数値はDeepSeek Harnessを含めた全比較対象の平均から算出されたものであり、Claude Code比の77%という数字は特定条件下の最大値である点に注意が必要だ。DeepSeek HarnessはStrands Harnessより約14%安いが、すべてのベンチマークでスコアが低かった。DeepSeekを除いた比較ではコスト優位性はさらに大きくなる。
コスト削減を支える3つのコンテキスト管理ルール
AWSチームはコスト・精度両面の改善を「コンテキスト管理が主な要因」と説明している。デフォルトで適用される3つのルールがその核心だ。
- 1,500トークンを超えるツール結果はトランケート(切り詰め)する
- コンテキスト使用率が85%を超えたらサマリー圧縮(compaction)を実行する
- ウィンドウがオーバーフローした場合はループ内でコンテキストリカバリーを行う
この設計は独立した研究とも整合する。HarnessTax studyは7モデルにわたってClaude Code、Codex CLI、Piを比較し、「ハーネスの選択は成功率にほとんど影響しないが、同じモデルで最大5倍のコスト差が生じる」と報告している。コストの差はモデルではなく、ハーネスの実装で決まるという知見だ。
導入と使い方
インストールはワンライナー。
pip install strands-harness
# または
npm install @strands-agents/harness
使い方も最小限だ。
from strands_harness import create_harness
agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("Research the top three vector databases and compare their pricing")
create_harness()一発で、Amazon Bedrock、Anthropic、OpenAI、Google、Ollama、LiteLLMのいずれかのモデルをターゲットにしたエージェントが立ち上がる。
デフォルトで使えるツールはシェル、ファイル操作(読み書き・編集)、Web検索。大きなツール結果はファイルにオフロードし、リクエストの再利用部分はキャッシュする。セッションIDによる会話再開や、長期メモリも標準で備わっている。
Strands CLI(npm install @strands-agents/strands-cli)を使えば、自然言語でエージェントをプロトタイピングし、/exportコマンドでPythonまたはTypeScriptのコードとして書き出すことも可能だ。ラップトップで試したエージェントがそのまま本番に組み込めるという設計になっている。
まとめ
- Apache 2.0のオープンソースで、Python・TypeScript対応
- 28%のトークンコスト削減を6ベンチマーク・複数ハーネスとの比較で報告(精度は同等)
- Claude Codeと同一モデルで比較した場合、コスト77%削減・精度7.9ポイント向上(77%は特定条件下の最大値)
- コスト削減の主因はコンテキスト管理(トランケート・圧縮・リカバリーの3ルール)
- AWSチームはベンチマークに関するフォローアップ論文を準備中
ハーネスという「モデルの外側」の実装がコストと精度の両方を左右するという事実は、エージェント開発に取り組むエンジニアにとって見過ごせない示唆だ。Strands Harnessは、その問題に対してベンチマーク付きで具体的な答えを示したOSSである。
詳細はAWS Strands Agents Team Releases Strands Harness: An Open-Source Agent Harness With 28% Lower Token Cost at Comparable Accuracyを参照していただきたい。