9月25日、MarkTechPostが「Liquid AI Releases LFM2.5-VL-3B-DSpark: Speculative Decoding for Vision-Language Models With Up to 3.13x Faster Decoding」と題した記事を公開した。この記事では、Liquid AIがVision-Language Model(VLM)向けのSpeculative Decodingドラフトモデル「LFM2.5-VL-3B-DSpark」を公開し、Apple SiliconおよびNVIDIA H100上でデコード速度を最大3.13倍に高速化した成果について詳しく紹介されている。
なぜ今、Liquid AIがVLM向けSpeculative Decodingを出すのか
VLMの推論コストは、テキストのみのLLMと比べてプリフィルフェーズが重くなりやすい一方、デコードフェーズの最適化余地は大きい。Speculative Decodingはテキストモデルへの適用が先行してきたが、画像入力を含むVLMへの展開は実装上の障壁から遅れていた。
Liquid AIはこの課題に対し、自社VLMであるLFM2.5-VL-3B向けのドラフトモデルを公開することで、同社のマルチモーダルモデル群の推論効率化を一気に推し進めた。背景には、オープンソースコミュニティにおいてSGLang・llama.cpp・MLX-VLMといった推論フレームワークのSpeculative Decoding対応が成熟しつつあり、エコシステムが整ってきたタイミングという判断があると見られる。
※編集部の考察:同時期にGoogleやMetaもVLMの軽量化・高速化を積極的に打ち出しており、エッジデバイス(特にApple Silicon)での実用性を示す本リリースは、VLM推論最適化競争における同社のポジション確立を意識したものと考えられる。
279.5Mパラメータのドラフターで3倍超の高速化
Liquid AIは、既存のVLMであるLFM2.5-VL-3Bに対応するSpeculative DecodingドラフトモデルLFM2.5-VL-3B-DSparkを公開した。
Speculative Decodingとは、小さなドラフトモデルが複数トークンを先読みして提案し、大きなターゲットモデルが一括で検証・採択する手法だ。通常のモデルが1フォワードパスで1トークンを生成するのに対し、複数トークンを1パスで処理できるため、スループットが向上する。
ドラフターのパラメータ構成は以下の通りだ。
| コンポーネント | パラメータ数 |
|---|---|
| デコーダスタック(4層) | 193.0M |
| 隠れ状態射影 | 21.0M |
| Markovヘッド | 65.5M |
| Norm + 信頼度ヘッド | 6.4k |
| 合計 | 279.5M |
埋め込みとLMヘッドはターゲットモデルと共有されるため、ドラフターは単体では保持しない。結果として、デプロイ時のパラメータ増加は**8.9%**に抑えられている。
モダリティを問わない設計が肝
設計上の重要なポイントがある。ドラフターはターゲットモデルの複数の隠れ層から状態を読み取り、次のkトークンを予測する。隠れ層に到達した時点で、テキストと画像パッチはいずれも単なるテンソルになっているため、ドラフターはモダリティを意識しない。
これにより、Liquid AIはテキストモデル向けに開発したDSparkの推論アルゴリズムをそのままVLMに流用している。アーキテクチャの詳細は4層のAttention-onlyモデルで、ブロックサイズは推論時に8または9を推奨(Apple Siliconでは8)。アブレーションスタディとトレーニングはAMDハードウェア上で実施された。
ベンチマーク結果
評価はMMSpecベンチマークに基づき、General VQA・Text VQA・Image Captioning・Chart VQA・Complex Reasoning・Multi-turn Conversationの6タスクで測定されている。バッチサイズ1、温度0、16bit重みの条件での結果は以下の通りだ。
| スタック | デコード高速化 | エンドツーエンド高速化 | パスあたり採択トークン数 |
|---|---|---|---|
| MLX-VLM、M5 Max MacBook Pro(ブロック8) | 2.30x〜3.13x | 1.56x〜2.62x | 3.24〜4.34 |
| llama.cpp、M3 Ultra(ブロック8) | 1.57x〜2.14x | 1.30x〜1.77x | 3.31〜4.50 |
| SGLang、H100 80GB×1(ブロック9) | 2.04x〜2.66x | 1.64x〜2.27x | 3.46〜4.57 |
M5 Maxでの3.13x(デコード)はCOCOキャプショニングタスクから、エンドツーエンド2.62xはMMM-Proから得られた数字であり、タスクが異なる点には注意が必要だ。
エッジデバイスでエンドツーエンドの改善幅が小さくなる理由
デコード速度が3倍になっても、エンドツーエンドの高速化が1.56x程度にとどまるケースがある。Liquid AIはこれをAmdahlの法則で説明している。Speculative Decodingが加速するのはデコードフェーズのみで、画像エンコーディングとプリフィルは変わらない。エッジデバイスではデータセンターGPUほどプリフィルが速くないため、全体レイテンシに占めるプリフィルの割合が大きくなる。TextVQAでM5 Max上のデコードが2.69x改善してもエンドツーエンドが1.56xにとどまるのはこのためだ。
なお、Greedyデコード(温度0)では、ターゲットモデルが全提案トークンを検証するため出力はベースモデルと完全に一致する。温度が高いほどドラフターとターゲットの不一致が増え、採択率と速度が低下する。
対応スタックと導入方法
重みはHugging FaceでSafetensorsとGGUF形式で公開されており、SGLang・MLX-VLM・llama.cppが初日からサポートしている。
- SGLang: v0.5.19以降が必要。
--speculative-algorithm DSPARKと--speculative-draft-model-pathを指定 - MLX-VLM: v0.7.2以降。
--draft-modelでドラフターを指定。現時点でGreedyサンプリング(温度0)のみ対応 - llama.cpp: GGUFドラフターをLFM2.5-VL-3B-GGUFターゲットと組み合わせる
各インテグレーションの実装はllama.cpp・SGLang・MLX-VLMのPull Requestで確認できる。
ライセンスはLFM Open License v1.0で、年間収益1,000万ドル未満の企業に限り商用利用が無償となる。この閾値を超える企業については別途ライセンス交渉が必要となる点、また再配布や派生モデルの公開にも制限が設けられている点は、商用導入を検討する際に事前確認が必要だ。量子化モデルへの対応は今回のリリース範囲外とされており、今後の課題となっている。
詳細はLiquid AI Releases LFM2.5-VL-3B-DSpark: Speculative Decoding for Vision-Language Models With Up to 3.13x Faster Decodingを参照していただきたい。