LLMの出力を変えずに最大3.18倍高速化 — Liquid AIが「先読みして一括検証」するドラフトモデルを公開、エージェント用途では遅延57%削減
DRANK

8月20日、MarkTechPostが「Liquid AI Releases LFM2.5-DSpark Draft Models That Deliver Up to 3.18x Faster Decoding Without Changing Model Outputs」と題した記事を公開した。Liquid AIが投機的デコーディング(Speculative Decoding:小さなドラフトモデルがトークン列を先読みし、大きなターゲットモデルが一括検証することでスループットを上げる手法)を用いてモデル出力を変えずに最大3.18倍の推論高速化を実現するドラフトモデル「LFM2.5-DSpark」を公開した。

by @tf_official
Related Topics: AI Machine Learning Deep Learning