9月28日、Zeus Kerravaraが「Agentic AI is breaking the token meter, and enterprises need a plan for what comes next」と題した記事を公開した。この記事では、エージェントAIの普及によってトークン課金モデルが企業のコスト管理を破綻させつつあり、本番運用に向けた新たな調達・コスト戦略が急務となっている実態について詳しく紹介されている。
「成功すると予算が爆発する」という構造的問題
エージェントAI(自律的にツール呼び出しや計画立案を繰り返すAIシステム)が本番環境に展開されると、トークン消費量が単純な推論呼び出しの10〜100倍に跳ね上がる。これはQumulusAIが提供・スポンサードしたFuturumの調査レポート「The Off Ramp From Per-Token Pricing」の中心的な知見だ。なお同レポートはQumulusAIの依頼によるスポンサードリサーチであり、商業的動機を持つ可能性がある点は読者が判断材料として留意しておきたい。
チャットボットは質問に答えるだけだが、エージェントは計画を立て、ツールを呼び出し、結果を確認し、リトライし、別のエージェントに引き継ぎ、要約する。これらの各ステップでトークンが消費される。変動課金モデルはこの爆発的な消費に比例してコストを請求し続ける。
著者のZeus Kerravaraは、実際にある企業が年間100万ドルの予算を組んだところ、AIプロジェクトが好調すぎて3ヶ月で使い切った事例を紹介している。問題は高い請求書だけではない。予測不能な請求がプロジェクト自体を殺す。Amberd.aiのCEO、Mazda Marvasti氏も「コストを正当化できずに社内自動化ツールを廃棄した顧客がいる」と述べており、これはガバナンスの失敗がコスト問題に見せかけられている状態だと指摘する。
前述のFuturumレポート(スポンサードリサーチ)の予測では、エージェント・推論インファレンスは今年だけで219%成長し、インファレンス全体の支出は2025年の1,200億ドルから2030年には8,850億ドルに達する見込みだ。変動課金モデルのままでは、コストが生み出す価値の成長を上回る速度で膨張する。
企業はすでに「オンデマンドクラウド」から離れ始めている
Futurumが824名のAI意思決定者を対象に行った調査では、AIコンピュートの消費の**66%が予約済みまたは自社所有のインフラによるもので、オンデマンドクラウドは19%にとどまっている。回答者の59%**がハイパースケーラーのパブリッククラウド外(自社データセンター、コロケーション施設、ベアメタルプロバイダー)でAIワークロードを主に稼働させている。
この動きはITインフラがたどったクラウド採用のサイクルそのものだ。まずオンデマンドで始め、定常的なワークロードは予約容量の方が安いと気づき、最終的にハイブリッドに落ち着く。AIはそのサイクルを年単位から四半期単位に圧縮しており、エージェントがその加速剤になっている。
ベアメタルの経済学:固定費は稼働率が全て
Amberd.aiがQumulusAIのベアメタル上で構築したアーキテクチャは具体的だ。8GPU構成のNVIDIA H200サーバーを4つの仮想環境(各2GPU)に分割し、レイテンシ許容度に応じて顧客を振り分けている。
「1台の8xH200サーバーで、2人の顧客がサーバー全体のコストをカバーする。そして30〜35人の顧客がそのサーバー上で稼働できる。2人目の顧客が来た時点でサーバーのコストは回収済みで、それ以降の顧客は純利益になる」—Mazda Marvasti(Amberd.ai CEO)
ただし記事はこの数字を礼賛するだけでなく、重要な留保を加えている。Futurumのガイダンスでは、稼働率が概ね60%以上の定常ワークロードに対してのみベアメタル予約が推奨される。また、このアプローチは「サービングエンジン、バッチ処理、量子化、KVキャッシュ管理などの専門知識が必要であり、ハードウェア専門知識のないチームでは運用コストが膨らむ」とも明記されている。
アイドル状態の予約済みGPUが最もコストの高いGPUだ、という逆説が本質をついている。
「オープンウェイトモデルへの移行」という選択肢
この「トークン課金からの出口戦略」が機能するのは、自社インフラ上に展開できるオープンウェイトモデル(LlamaやMistralなど、重みが公開されているモデル)を使う場合に限られる。GPT-4やClaude等のフロンティアモデルをAPIやクラウドマーケットプレイス経由で使う企業には、ベアメタルという選択肢は存在しない。価格のレバーはモデルプロバイダー側にある。
RunpodのCTO、Brennen Smith氏は「予測可能なワークロードには固定リース契約が適切で、実験・スケーリング・変動する負荷にはオンデマンドが必要。CFOには両方の予算を確保することを勧める」と述べている。
IT・財務リーダーへの実践的指針
記事の末尾では、以下の5点が提言されている:
- コストをトークン単位ではなくタスク単位で計測する(チケット1件の解決コスト、申請1件の処理コスト等)
- 段階移行のトリガーを定義する:API→オンデマンドGPU→予約容量への移行条件を事前に決める(稼働率60%がひとつの目安)
- 自社の運用スキルに正直になる:専門知識がなければ、マネージドサービスのコストも含めて試算する
- オープンウェイトモデルを今すぐテストする:移行できるワークロードはトークン課金から外れられる
- ハードウェアアップグレードパスについて契約交渉する:今日のコミットメントが将来の塩漬け資産にならないようにする
エージェントAIで勝つ企業は、最良のモデルを持つ企業ではなく、大規模に稼働させるコストを確保できた企業だ、というのが記事の結論だ。
詳細はAgentic AI is breaking the token meter, and enterprises need a plan for what comes nextを参照していただきたい。