10月2日、SiliconANGLEが「Nvidia links AI factory economics to inference and efficiency- SiliconANGLE」と題した記事を公開した。NvidiaのVP Ian Buck氏がFully Connected 2026で語った内容は、AIインフラの経済的な評価軸そのものを問い直すものだった。「GPUスペックで調達を判断する時代は終わり、電力あたりのトークン生成量(tokens per watt)が競争力の基準になる」——この主張が、データセンター事業者やインフラ設計者にとって何を意味するかを以下に紹介する。
「トークン」がAIファクトリーの通貨になる
NvidiaでハイパースケールおよびHPC部門のVP兼GMを務めるIan Buck氏は、Fully Connected 2026イベントでの取材に対し、AIインフラの経済的な本質をこう表現した。
「自動車でも、デバイスでも、PCでもない。トークンだ。これらの資産はITではなく、コストでもない。実際には、価値が増し、収益を生み出し、流通可能で、耐久性があり、生産的な経済の一部だ」
この発言はAIインフラをめぐる議論の核心を突いている。GPUの調達競争から、「どれだけ効率よくトークンを生産できるか」という経済モデルへの転換だ。
データセンター全体をひとつの計算システムとして捉え直す必要があるとBuck氏は指摘する。ネットワーク、ストレージ、プロセッサ、ソフトウェアが連携して初めて、投入した電力あたりのトークン生成量(tokens per watt)が最大化される。
推論は「撃ちっ放し」ではない
多くの組織がAIモデルをデプロイした後も、モデルの更新が継続的に必要になる点をBuck氏は強調した。
「これらのサービスを一度動かして終わり、というわけにはいかない。企業はモデルを使いながら、精度を高め、アライメントを調整し、データを追加し続けている。最新の状態を保つこと、それ自体が少しのトレーニングを必要とする。強化学習やオンラインアライメントの取り組みがまさにそこに向けられている」
つまり推論フェーズとトレーニングフェーズは完全に切り離されるものではなく、運用中も継続的なモデル更新が発生する。インフラ設計においてこの「継続的学習」のワークロードを無視すると、実運用でのコストが想定を超えることになる。
低レイテンシに経済的プレミアムが生まれる
速い応答が直接的な価値を持つユースケースでは、単なるスループット最大化とは別の経済層が形成される。元記事によれば、Nvidiaはこのニーズへの対応として、Vera Rubin プラットフォームと組み合わせるLPX推論アクセラレータに言及しており、その文脈でGroqがパートナーとして登場している。
「トークンを可能な限り速く処理することに価値があるなら、LPXをVera Rubin上に組み合わせることでそれが実現できる。フィンテックなど、リアルタイム性が求められる領域で強い関心を見ている」
なお、「LPX」の製品定義やGroqとNvidiaの関係については元記事の記述に基づいており、製品の帰属・仕様の詳細は元記事にて確認されたい。
電力こそがデータセンターの天井
AIインフラ拡張を物理的に制約する要因として、Buck氏は電力容量を挙げた。
「データセンターには自然な上限があり、それはまさに電力だ。GPUの世代ごとに、tokens per wattを10倍以上改善することを目標にしている。Blackwellでは最終的に30倍のtokens per watt改善を達成した」
この30倍という数字は、前世代アーキテクチャであるHopperとの比較としてBuck氏が示したものだ。同じ電力枠で扱えるトークン量が大幅に増加することを意味し、データセンター事業者にとっての収益性に直結する指標として位置づけられている。ただし、この数字はNvidiaが主張する値であり、測定条件やワークロードの前提については元記事の文脈で参照する必要がある。
Blackwellは2024年にNvidiaが発表したGPUアーキテクチャで、前世代のHopperに対して大幅な効率改善を実現したとされている。
構成の選択に関しては、CoreWeaveがスループット重視・低レイテンシ重視のバランスを顧客が意識せずに最適化できる上位のインファレンスサービスを提供していると説明した。
「CoreWeaveが顧客に代わってそれをできる。選択肢の多さに圧倒される必要はない。それがパートナーエコシステムの重要性だ」
評価軸の転換が迫るインフラ設計の再考
Buck氏の語るAIファクトリーの経済論が実務に与える含意は、単なる製品選定の話にとどまらない。tokens per wattを主軸に置くと、設備投資の正当化ロジック・世代更新の判断基準・パートナー選定の優先順位がいずれも変わる。
「GPUの世代選定はスペックではなくtokens per wattで比較する」という評価軸の転換は、CTOやインフラ設計者にとってROI計算の前提を見直すことを意味する。推論フェーズでも継続的なトレーニングが発生するという指摘も加わると、インフラは「一度設計して終わり」ではなく、学習ワークロードとの共存を前提とした動的な設計が求められる。また、低レイテンシ処理に経済的プレミアムが付くという観点は、フィンテックをはじめとするリアルタイム処理領域において、スループット一辺倒ではない投資判断を後押しする論拠となりうる。
詳細はNvidia links AI factory economics to inference and efficiency- SiliconANGLEを参照していただきたい。