10月2日、firethering.comが「AI Is Getting Cheaper. So Why Are AI Bills Going Up?」と題した記事を公開した。コストが下がるほど企業のAI支出が膨らむという逆説の答えは、「単価」ではなく「使用量の設計」にある。
AIの「思考コスト」は18ヶ月で750分の1以下になった
Epoch AIのデータによると、特定のベンチマーク性能を達成するためのコストは2023年以降、四半期ごとに約47%のペースで下落している。
具体的な数字を見ると、インパクトは大きい。2025年1月にOpenAIがo3をリリースした時点で、GPQAダイヤモンドベンチマーク(化学・物理・生物学などの高度な知識を問う試験)で75%スコアを達成するためのコストは1問あたり約0.30ドルだった。その後、GPT-5.6 Luna(OpenAIが2026年にリリースした軽量推論モデル)が同等の性能を約0.0004ドルで達成するに至った。
同じ水準の能力が、比較的短期間で数百分の一のコストで手に入るようになった計算だ。
ただし、コスト削減の速度はタスクの種類によって異なる。
- 数学・純粋論理:四半期あたり約50〜52%の削減(最も速い)
- ハードサイエンス:同様の下落傾向
- チェス・パズル系タスク:約39〜43%
- SWE-bench(ソフトウェアエンジニアリング):約27.5%(最も遅い)
ソフトウェアエンジニアリングの改善が遅い理由について、元記事は「実際のバグ修正には『なぜそのシステムがそう設計されたか』の理解が必要であり、テスト上で正しいコードを出力することとは本質的に異なる」と説明している。テストをパスするコードを生成する能力と、既存のシステム文脈を把握した上で適切な修正を行う能力は別物であり、後者のベンチマーク改善には前者ほどの速度が出ないということだ。
逆説:1回の呼び出しは安くなったのに、請求額は上がる
ここが記事の核心だ。単価が下がっても、使用量がそれ以上に増えれば総コストは上がる。
シンプルなチャットボットのやり取りであれば、消費するトークン数は数百程度だ。しかしエージェント型のワークフローになると話が変わる。コーディングエージェントが大規模なリポジトリを処理する場合、ファイルの読み込み・変更・テスト実行・エラー確認・リトライを繰り返すため、1タスクあたりのトークン消費量は大幅に増える。個々のAPI呼び出しは安くなっているが、呼び出し回数が急増するのだ。
Gartnerはこれを「推論のパラドックス(Inference Paradox)」と呼んでいる(Gartner "Top Strategic Technology Trends for 2025" に基づく概念)。AIが複雑なタスクをこなせるようになるほど、企業はより多くの推論を必要とするワークフローを構築する。Gartnerは、エージェント型ワークフローの推論コストの合計が2028年までに5倍以上に増加すると予測している。
言い換えれば、コスト削減がそのまま支出削減につながらないのは、安くなったことで「これまで試みなかった用途」への投資が加速するためだ。1トークンあたりの単価が下がるほど、企業が構築するエージェントの複雑さと処理量は増加し、請求額は逆方向に動く。
アーキテクチャ設計が競争優位の軸になる
コストが下がったことで、ソフトウェアの設計思想も変わりつつある。
以前は「AIの呼び出し回数をどう減らすか」がアーキテクチャ上の主要な関心事だった。コストが高かったからだ。しかし単価が十分に安くなると、コーディングエージェントがコードを書き、テストを走らせ、失敗を確認し、再試行するという一連のループを、各ステップを「高コストな例外」として扱わずに設計できるようになる。さらに別のモデルがその出力をレビューし、別のモデルが複数のアプローチを比較してから最終結果を返す、という構成も現実的になる。
設計の問いが「AIの呼び出しをどう減らすか?」から「それらの呼び出しをどう効果的に設計するか?」へとシフトしている。
具体的には、以下のような判断がシステム設計の品質を左右するようになっている。
- モデルの使い分け:安価な軽量モデルをどの処理ステップに割り当て、高性能モデルをどこにだけ投入するか
- コンテキストの制御:各呼び出しにどれだけの情報を渡すか。コンテキストが長くなるほどコストは増加する
- 推論ステップの評価:追加の推論ループが実際にアウトプットの質を改善する箇所と、無駄になる箇所の見極め
- フォールバック設計:エラー時の再試行戦略をどう設計するか。無制限のリトライはコストを急増させる
記事が指摘するとおり、優位性はモデルの選定よりもシステム設計から生まれる時代になってきている。安いモデルをどの場面で使い、高性能なモデルをどこにだけ投入するか。こうした判断を適切に行えるシステムが、AI支出の効率を左右する。コストが下がった今こそ、「どれだけ使うか」より「どう使うか」の設計力が問われている。
詳細はAI Is Getting Cheaper. So Why Are AI Bills Going Up?を参照していただきたい。