MetaがコンシューマGPU1枚で動く30Bモデル「Muse Glimmer」を公開 — 蒸留と予測生成の組み合わせで推論を最大3.1倍高速化
DRANK

8月11日、Rohail Saleemが「Meta Fires Back At China's 15-Week AI Token Dominance With Muse Glimmer, Which Can Fit Inside A Single GPU And Uses An Innovative Technique To Speed Up Responses」と題した記事を公開した。Metaが単一コンシューマGPUで動作する30BパラメータのオープンウェイトAIモデル「Muse Glimmer」をリリースし、蒸留とスペキュレーティブデコードを組み合わせて推論を高速化する仕組みを解説している。

by @tf_official
Related Topics: AI Machine Learning Deep Learning