Qwen3.8-27BをVRAM 16GBのGPU一枚で動かす — 量子化とキャッシュ設定で「32GB必要」の常識を覆す
DRANK

8月23日、autodidacts.ioが「How to fit Qwen3.8-27B into 16GB of VRAM and run it on a single RTX 3080 card: the best quantizations and Llama.cpp flags I've found」と題した記事を公開した。この記事では、Qwen3.8-27BをVRAM 16GBのRTX 3080一枚で実用的に動かすための量子化選択とllama.cppフラグの設定について詳しく紹介されている。27Bパラメータのモデルは「32GB以上のVRAM向け」というのが通説だ。公式のLlamaサイトもQ8以下の量子化へのリンクを張らず、Q4未満は「幼児と話しているようなもの」、KVキャッシュの量子化は「ロボトミー手術」と称されることが多い。それでもRTX 3080(VRAM 16GB)一枚で動かした記録がこの記事だ。なお、Qwen3.8はAlibabaのQwenチームが開発するQwen3ファミリーの27Bパラメータモデルで、ハイブリッド推論(Thinking/非Thinkingモード切り替...

by @tf_official
Related Topics: AI Machine Learning Python