ローカルLLMが2倍速になる設定をオフのまま使っている — 出力品質を変えずに速度を上げる「投機的デコーディング」の仕組みと使い方
DRANK

7月25日、vettedconsumer.comが「Speculative Decoding, Explained: The Free Speed Toggle Your Local LLM Is Probably Not Using」と題した記事を公開した。LM StudioやLlama.cppには、モデルの出力を一切変えずに生成速度を1.5〜2.5倍に引き上げられる設定が存在する——それが「Speculative Decoding(投機的デコーディング)」だ。ほとんどのユーザーはオフのまま使っており、オンにしてもペアリングを間違えて逆に遅くなるケースも多い。

by @tf_official
Related Topics: AI Machine Learning Deep Learning