9月29日、Martin Aldersonが「The AI margin collapse is gathering pace」と題した記事を公開した。OpenAI・DeepSeek・Anthropicが相次いでAI推論価格を大幅に引き下げており、フロンティアモデルのマージン崩壊が加速しているという市場動向を詳しく論じている。
OpenAIが2ヶ月で90%値下げという異常事態
7月末、OpenAIはGPT-5.6 Luna(軽量モデル)を80%値下げした。これだけでも市場に衝撃を与えたが、その後さらに50%の追加値下げを実施。結果として約2ヶ月で合計90%の値下げとなった。上位モデルのGPT-6 Solも同期間で60%下がっている。
この値下げの直後、LunaはOpenRouter(複数のAIモデルAPIを一元的に利用できるプロキシサービス)のトップモデルランキングで首位を獲得した。非オープンウェイトモデル(重みが公開されていないプロプライエタリモデル)がこの位置に来るのは久しぶりのことだという。
Aldersonはこれを「フロンティアラボとしては異例に攻撃的なペース」と評している。効率化だけでは2ヶ月での90%削減は説明がつかないというのが彼の見立てだ。
※なお、本記事に登場するGPT-5.6 Luna、GPT-6 Sol、Opus 5.5、DeepSeek V4.1-Flash、Haiku 5.5、Fable、Astraといったモデル名は元記事執筆時点(2026年9月末)のものであり、一部はベータ版・仮称の可能性がある。
DeepSeekの逆張り:価格は上がっているが、キャッシュが安い
DeepSeekの動きは少し毛色が異なる。公式APIの価格推移を見ると、4月のベースラインから出力価格はオフピーク時で約2倍、ピーク時で約4倍に上昇している。
| モデル | 時間帯 | 入力 | キャッシュ読み出し | 出力 |
|---|---|---|---|---|
| V4-Flash(Apr) | フラット | $0.14 | $0.028 | $0.28 |
| V4.1-Flash(Sep) | オフピーク | $0.15 | $0.003 | $0.60 |
| V4.1-Flash(Sep) | ピーク | $0.30 | $0.006 | $1.20 |
ただし、注目すべきはキャッシュ読み出し(Cache Read)の価格だ。V4.1-FlashのオフピークはLunaより入力・出力ともに高いが、キャッシュ読み出しは$0.003/Mトークンと、Lunaの$0.01/Mに対して3分の1以下になっている。
Aldersonが別記事で詳述しているように、エージェント的なユースケース(AIが自律的に複数ステップのタスクを実行する用途)ではキャッシュ読み出しがコストの大半を占める。そのため「入力・出力の単価ではOpenAIが安くなった」という表面的な比較は、実際のワークロードではひっくり返ることが多い。
具体的に試算すると以下の通りだ(100万トークンあたりの単価):
| モデル | 入力 | キャッシュ読み出し | 出力 | セッションA | セッションB(キャッシュ多め) |
|---|---|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.01 | $0.50 | $0.25 | $0.27 |
| DeepSeek V4.1-Flash(オフピーク) | $0.15 | $0.003 | $0.60 | $0.23 | $0.15 |
| GPT-6 Sol | $2.00 | $0.20 | $10.00 | $5.00 | $5.40 |
| Opus 5.5 | $4.00 | $0.20 | $20.00 | $8.00 | $6.80 |
セッションAは1,000万キャッシュ読み出し・50万入力・20万出力、セッションBはさらにキャッシュ比率を高めたケースを想定している。キャッシュが重くなるほどDeepSeekが有利になる構造だ。
DeepSeekの「ピーク時間」は中国時間の昼間であるため、西洋のタイムゾーンからは実質的にオフピーク料金で利用できることが多い。
Anthropicも動いた:価格据え置き路線の終わり
Anthropicはこれまで価格競争に消極的だったが、Opus 5.5で方針を転換した。入力・出力を20%値下げしたうえ、キャッシュ読み出しは60%引き下げた。
この転換の背景にあるとAldersonが指摘するのが、Fable(上位モデル)の普及の鈍さだ。厳しいガードレールと高い価格設定が障壁となり、ユーザーがFableではなくOpusにとどまり続けているという状況が、価格見直しを迫った可能性がある。
キャッシュ読み出しの60%削減は、長いエージェントセッションでのブレンドコスト(複数料金区分を組み合わせた実効コスト)を最大50%削減できる場合があると試算されている。また、Haiku 5.5(Lunaの直接競合になるモデル)が数週間以内に登場する見込みで、OpenAIとの正面対決が予想される。
フロンティアモデルの需要が縮む構造問題
Aldersonが最も重要視しているのは価格そのものではなく、フロンティアモデルの存在意義が問われ始めているという点だ。
Luna、DeepSeek V4.1-Flashといった軽量モデルが実用レベルの性能を持ち、速度も速くなっている。「一般的なオフィスワーカーの業務には小型モデルで十分になっており、ソフトウェアエンジニアリングのタスクも同様になりつつある」と彼は述べている。
GPT-6 Sol、Opus、Astraクラスのモデルは、特定の高度な用途に向けたニッチな存在へと移行しつつあるかもしれない。問題はこれらの巨大モデルが桁違いの訓練コストを要する点だ。需要が下がれば1回のトレーニングランのコストを回収するのに時間がかかる。訓練費はR&D費として計上されるためグロスマージン(売上総利益率:売上からサービス提供の直接原価を差し引いた利益率)には直接表れないが、回収できるかどうかは別問題だ。
この構造を踏まえてAldersonが示す2つのシナリオが興味深い:
推論効率と小型モデルの品質に軸足を移す:巨大モデルの訓練から撤退し、効率改善に集中する。中国のラボはコスト面でこの戦略に向いている。規制によってフロンティア競争をペースダウンさせようとする動きは、この文脈では「高価なトレーニングランを長く使い回せる」という利便性をラボにもたらす側面もある。
垂直統合型サービスへシフト:巨大モデルを外部APIとして提供するのではなく、製薬向け最先端科学研究などの高付加価値分野で自社内利用に絞る。Anthropicが生物学ラボをひそかに立ち上げたのはこの流れと整合する動きだ。
Aldersonの現時点での見方は、「市場は今後、生の知能の高さよりも推論効率のブレイクスルーを達成できるプレイヤーを評価する方向にシフトしていく」というものだ。
詳細はThe AI margin collapse is gathering paceを参照していただきたい。