10月3日、Tom's Hardwareが「AI agents use 5x more tokens than humans as cached prompts explode, headed for 10x」と題した記事を公開した。AIエージェントが人間の5倍ものトークンを消費しており、その85%超がキャッシュ済みプロンプトの再読み込みであるという実データを紹介している。なお、この85%超という数字はOpenRouterの全体データから導かれたものであり、後述する96%という数字は個別企業の事例における値である。
エージェントが人間の5倍のトークンを消費——OpenRouterの実数
AIモデルのゲートウェイ・ルーティングプラットフォームであるOpenRouterのデータが、エージェント時代のトークン消費構造を如実に示している。
2026年8月時点で、エージェントのトークン消費量は7.3兆トークンに対し、人間は1.4兆トークン。比率にして約5.2倍だ。OpenRouterのインサイト責任者Peter Walkerによれば、エージェントがヒューマン利用を初めて上回った2026年2月の「クロスオーバーポイント」以降、エージェントのトークン使用量は14倍に増加した一方、人間の使用量は2.8倍にとどまっている。
この数字はFuturum GroupのCEO Daniel Newmanがa16z(Andreessen Horowitz)のチャートとともにXに投稿し、広く注目を集めた。
「AIは現在、人間よりも5倍多く使われている。この数字は10倍、そしてさらに加速していく。ROIを語る際に人間の採用率を指標にし続けているが、実際の利用規模はそれをはるかに超えている」
— Daniel Newman(Futurum Group CEO)、X投稿より
消費の85%以上は「キャッシュの再読み込み」
ここが最も重要なポイントだ。エージェントが消費するトークンの85%超はキャッシュ済みプロンプト——すなわち、すでに読んだコンテキストの再読み込みである。
この傾向は個別企業の事例でも裏付けられている。元記事によれば、コールセンター向けコンサルティングを手がける企業(記事中では社名は明記されていない)が、レンタルしたNvidia H200上でDeepSeekをテストした際、Claude Codeを使った自社エージェントの2026年9月の使用ログにおいて、「全入力の96%が過去の会話の再読み込みだった」という結果が出ている。この96%はあくまで当該企業の個別事例の値であり、OpenRouter全体の85%超とは別の数字として区別して読む必要がある。
キャッシュトークンはゼロから処理するよりコストが大幅に低い。しかしa16zが指摘するように、キャッシュはメモリ上に保持し続ける必要がある。モデルがコンテキストを保持するための仕組みはKVキャッシュ(Key-Valueキャッシュ)と呼ばれ、すでに「KVキャッシュがGPUのHBM(高帯域幅メモリ)容量を超えつつある」状況だ。
つまり、課金額はトークン数ほど膨らまないが、ハードウェアコスト——特にメモリ——は現実の問題として残る。
HBM不足に直結するエージェント増殖
a16zはOpenRouterの出資者でもあり、このキャッシュ需要の増大をHBM需要の拡大と直接結びつけている。Micronは2027〜2028年にかけてRAMとストレージの不足が深刻化し、価格が上昇すると予測しており、メモリメーカーはAIデータセンター向けHBMを優先する姿勢を示している。
スケール感を補足するデータも存在する。McKinseyの「2026 State of AI」サーベイによれば、大規模組織でAIエージェントを本格展開していると回答した割合は**40%**に達し、1年前の27%から急増している。
Newmanが予測する「5倍→10倍→20倍→30倍」のシナリオが現実になれば、PC向けメモリ市場もエージェントとの争奪戦に巻き込まれる可能性がある。
データの留意点
この数字を読む際にいくつか注意が必要だ。
- OpenRouterはAPIキーを「エージェント」「混合」「人間」の3カテゴリに分類しているが、分類基準はツールコール率・ターン数・ギャップタイミング等を含む7シグナルの加重スコアであり、境界は厳密ではない
- 「混合」カテゴリは同期間で4.7倍に成長しており、エージェントと人間の実際の比率はデータの読み方によって変わりうる
- データはトークン量であって支出額ではない
- 4月と7月にはトレンドの落ち込みがあり、成長は単調ではない
- あくまで1プラットフォームのデータである点も留意が必要だ
とはいえ、OpenRouterという規模のあるプラットフォームでこれほど明確な傾向が出ていること、そして独立した企業のユースケースでも96%という近似値が出ていることは、方向性として信頼に足るデータと言える。
詳細はAI agents use 5x more tokens than humans as cached prompts explode, headed for 10xを参照していただきたい。