8月11日、Rohail Saleemが「Meta Fires Back At China's 15-Week AI Token Dominance With Muse Glimmer, Which Can Fit Inside A Single GPU And Uses An Innovative Technique To Speed Up Responses」と題した記事を公開した。Metaが単一コンシューマGPUで動作する30BパラメータのオープンウェイトAIモデル「Muse Glimmer」をリリースし、蒸留とスペキュレーティブデコードを組み合わせて推論を高速化する仕組みを解説している。
単一コンシューマGPUで30Bモデルを動かす仕組み
Metaが発表したMuse Glimmerは、300億パラメータ(30B)のオープンウェイトモデルでありながら、24GBまたは32GB VRAMのコンシューマ向けGPU上で動作する。これを可能にしているのが量子化(クオンタイゼーション)だ。
通常、30Bモデルをfp16(半精度浮動小数点)でそのまま動かすには、重みだけで約60GB(30×10⁹×2バイト)のメモリが必要になる。MetaはMuse Glimmerの親モデルにあたるMuse Sparkを使った知識蒸留(ナレッジディスティレーション)によってモデルを圧縮し、重みのメモリ要件を20GBまで削減した。Metaによれば、この圧縮によるパフォーマンスへの実質的な影響はないとしている。
ただし、重みの20GBに加え、推論時にはKVキャッシュ(生成中の注意機構の中間状態を保持するメモリ領域)として一般に2〜4GBが別途必要になる。合計すると22〜24GBとなり、24GB VRAMカードではメモリに余裕がない。コンテキスト長が長い用途や、使用する量子化フォーマットによってはVRAMを超過するリスクも念頭に置いておく必要がある。32GB VRAMカードであれば、こうした懸念は大幅に緩和される。
なお、Muse Glimmerと同じコンシューマ向けGPU市場を意識して開発されたモデルとしては、Googleの**Gemma 4やAlibabaのQwen 3.6**が挙げられる。元記事ではこれらが競合として明示されており、Muse GlimmerはVRAM要件と推論速度の両面でこれらへの対抗軸を意識した設計となっている。
推論を最大3.1倍高速化する「DFlashドラフターモデル」
もう一つの核心が、応答速度の改善に使われた**スペキュレーティブデコード**の仕組みだ。
スペキュレーティブデコードとは、小型のドラフトモデルが先にテキストの塊を予測し、メインモデルがその結果をまとめて検証するアーキテクチャである。テキストを一から生成するよりも「答えが正しいかどうかを確認する」方が計算コストが低いため、全体のスループットが向上する。
Muse GlimmerではDFlashドラフターモデルと呼ばれる小型の補助モデルがこの役割を担う。Metaが公開したベンチマークによれば、速度向上の効果は以下の通りだ:
- NVIDIA RTX 5090:3.1倍高速化
- Apple M5 Max:1.8倍高速化
- Apple M4 Max:1.5倍高速化
ハイエンドGPU上での3倍超という数字は実用的に大きな差であり、ローカル推論環境での快適さに直結する。
背景:中国モデルが15週連続でグローバルトークン数首位
このタイミングでのリリースには一定の文脈がある。AIモデルのAPIトラフィックを集計するOpenRouterのデータによれば、8月3日週のグローバルAIモデル利用量は週間69兆トークン(前週比+21.48%)に達した。このうち中国モデルが34.25兆トークンを占め、米国モデルはわずか9.17兆トークンにとどまった。中国モデルが週間トークン数でグローバル首位を維持するのは15週連続だ。
特にDeepSeekのV4 Flashは前週比570%増という急成長を記録している。
元記事はこのデータを根拠にMuse Glimmerのリリースを「中国モデルへの反撃」と位置づけているが、留意点もある。OpenRouterのトラフィックデータは同プラットフォーム経由の利用量であり、全世界のAI利用を代表するものではない。また、利用量の多い国籍モデルが直ちに競争上の脅威を意味するかどうかは、利用文脈や地域分布など別の要因とあわせて判断が必要だ。
※編集部の考察:Muse Glimmerがこのトレンドにどれだけの影響を与えるかは、次週以降のOpenRouterのデータで確認できる見通しだ。リリースのタイミングに地政学的な意図があるとしても、技術的な評価はベンチマーク結果と実際の利用者フィードバックによって独立して判断されるべきだろう。
まとめ
Muse Glimmerの技術的なポイントを整理すると、「蒸留で60GB→20GBに圧縮してコンシューマGPUに収め、スペキュレーティブデコードで最大3.1倍の高速化を実現する」という構成だ。24GB VRAMカードでの動作はKVキャッシュ込みのメモリ配分がタイトになる点は注意が必要だが、オープンウェイトモデルをローカルで動かす需要が高まる中、ハードウェアのハードルを下げながら速度も確保するアプローチは実用的な方向性といえる。