RTX 3090(VRAM 24GB)でQwen 3.6 35B MoE(実効3B)を140 tok/sで動かす — CUDA vs Vulkan、CPUオフロードの実測値まとめ
DRANK

7月25日、Giles Thomasが「Benchmarking Qwen 3.6 35B MoE (3B active) on an RTX 3090」と題した記事を公開した。RTX 3090(VRAM 24GB)上でQwen 3.6 35B MoEモデルを動かし、VulkanとCUDAそれぞれの構成でベンチマークを取った結果だ。CUDA版で140 tok/sという実用的なスループットが出た一方、「MoEだからVRAMが少なくて済む」という誤解を丁寧に解説している点も読みどころになっている。

by @tf_official
Related Topics: CUDA AI Deep Learning