24GB GPUで27Bモデルを256K全域・50トークン/秒で動かす — 「精度の高いドラフターが速度を落とした」反直感的な最適化の記録
DRANK

8月17日、Michal Piszczekが「Qwen3.8 27B at 256K: 50 TPS on a 24 GB GPU」と題した記事を公開した。24GB VRAMのGPU上で27Bパラメータのモデルを256Kコンテキスト全体で動作させながら平均50トークン/秒を達成するまでの実験過程を詳述した内容だ。

by @tf_official
Related Topics: AI Machine Learning CUDA