llama.cppのn-gramキャッシュを最大140倍高速化——「マップを参照渡しにするだけ」で25倍速になった最適化の記録
DRANK

9月26日、Hayder Tirmziが「42x Faster Prompt Lookup Drafting in llama.cpp」と題した記事を公開した。llama.cppにおけるPrompt Lookup Decodingのドラフティングを最大42倍高速化し、メモリ使用量を最大2.6倍削減した手法について詳しく紹介している。

by @tf_official
Related Topics: AI C++ Machine Learning