2021年製ノートPCの4GB GPUでGemma 4が76トークン/秒で動く — 9.5GBのモデルを1.2GBに圧縮して完全ローカル動作させる手順
DRANK

10月3日、dev.toのユーザーgdeが「Gemma 4 at Over 70 Tokens/s on a 2021 Laptop's 4 GB GPU: The Live Demo, Step by Step」と題した記事を公開した。本来9.5GiBあるGemma 4のモデルを1.2GiBまで圧縮し、2021年製ノートPCの4GB GPU上で76トークン/秒という実用的な速度で完全ローカル動作させた、という内容だ。LLMのローカル実行はハイエンドGPUが前提とされがちだが、この記事はその常識を覆す具体的な手順を示している。

by @tf_official
Related Topics: AI Machine Learning Deep Learning