AMD製GPUでLLM推論を最大5倍高速化——「まとめて予測して一括検証」するDFlashがNVIDIA以外の選択肢を実証
DRANK

9月16日、AMD ROCmブログが「DFlash Speculative Decoding on AMD Instinct MI355X: Up to 5× Faster Qwen3.5 Inference」と題した記事を公開した。AMD Instinct MI355X上でブロック拡散型の投機的デコード手法「DFlash」をvLLM経由で動作させ、Qwen3.5推論を最大5倍高速化した検証結果を詳しく紹介している。なぜ今、投機的デコードなのかLLM推論の単一リクエストレイテンシは、計算量ではなくウェイトの転送速度(メモリ帯域)に律速される。1トークン生成するたびに大規模モデルの全重みをGPUメモリから読み出す必要があるためだ。**投機的デコード(Speculative Decoding)**はこのボトルネックを回避する手法で、小さな「ドラフトモデル」が複数トークンを先読み提案し、大きな「ターゲットモデル」がそれを1回の並列パスで検証・採択する。複数トークンをまとめて確定できれば、ターゲットモデルの検証コストを分散できる。ただし従来のドラフト手法(EAGLE系や、Qwen3.5に内蔵さ...

by @tf_official
Related Topics: AI Machine Learning Deep Learning