9.5GBのAIモデルを1.6GBに圧縮して2021年製4GB GPU搭載ラップトップで動かす — QATとlazy loadingで実現する省メモリ推論の仕組み
DRANK

9月11日、xbillが「Gemma 4 on an 2021 Era 4 GB Laptop GPU: QAT Takes It From 9.5 GiB to 1.6」と題した記事を公開した。9.5GiBのモデルを1.6GiBに収めて、2021年製の4GB GPUで動かす——そんなことが本当に可能なのか、と思う読者も多いだろう。この記事は、GTX 1650 Ti搭載のラップトップという制約の中でGemma 4を実際に動かすまでの手順と、それを可能にした仕組みを詳しく解説している。

by @tf_official
Related Topics: AI Machine Learning Deep Learning