vLLMがGPU1基あたり25,000トークン/秒を達成 — ハイブリッドアーキテクチャのMoEモデルを分散サービングで限界まで引き出す
DRANK

8月6日、vLLMが「vLLM Reaches 25K Total TPS/GPU on Qwen3.5」と題した記事を公開した。この記事では、disaggregated serving(分散サービング)とBlackwell向け最適化カーネルを組み合わせることで、Qwen3.5をGB200 NVL72システム上で25,000トークン/秒/GPUという性能に到達させた経緯と再現手順について詳しく紹介されている。この数字が際立つのは、通常のTransformerとは異なるハイブリッドアーキテクチャのモデルをdisaggregated servingで動かすという、複数の技術的難所を同時にクリアした上での達成だからだ。

by @tf_official
Related Topics: AI Machine Learning CUDA