70BモデルのVRAM要件を140GBから35GBに落とす — LLM量子化・プルーニング5手法を実装コードで比較
DRANK

8月28日、KDNuggetsが「Quantization and Pruning Methods to Make Your LLM Leaner」と題した記事を公開した。70BパラメータのモデルをFP16で保存すると、ロードするだけで約140GBのVRAMが必要になる。A100が4枚、リクエストを1件も処理する前からそれだけのハードウェアを用意しなければならない計算だ。同じモデルを4ビット量子化(AWQまたはGPTQ)すると35〜40GB程度まで圧縮できる。クラスタが不要になり、ハイエンドワークステーション1台で動く。本記事はその実現方法を、量子化・プルーニング5手法の実装コード付きで解説したものだ。

by @tf_official
Related Topics: AI Machine Learning Deep Learning