llama.cppのLLM推論を最大42倍高速化 — 「参照渡しへの変更」など実装レベルの最適化だけで達成、アルゴリズムは一切変えず
DRANK

9月26日、Hayder Tirmziが「42x Faster Prompt Lookup Drafting in llama.cpp」と題した記事を公開した。この記事では、llama.cppのn-gramキャッシュ実装に対するシンプルな最適化を積み重ねることで、プロンプトルックアップドラフティングをコーパスサイズに応じて4.5倍〜42倍高速化した手法が紹介されている。なお記事公開後にDaniel Lemireによる追加最適化も加わり、元のllama.cppからの総合的な高速化は最大140倍に達する。この点については末尾のセクションで触れる。

by @tf_official
Related Topics: AI Machine Learning C++