LLM推論エンジンvLLM 0.28.0リリース — KVキャッシュをディスクまで退避可能に、MoEモデル向けall-gatherカーネルを最大3倍高速化
DRANK

8月30日、php-net.proが「vLLM 0.28.0 ships with Kimi-K3 optimizations and tiered KV cache offloading」と題した記事を公開した。LLM推論エンジン「vLLM」のバージョン0.28.0がリリースされ、Kimi-K3モデルへの大規模最適化や段階的KVキャッシュのディスクオフロード機能が追加された。vLLMはLLMをGPU上で効率的に推論するためのOSSエンジンで、PagedAttentionやcontinuous batchingといった技術によりスループットと低レイテンシを両立する。Hugging Faceモデルとの互換性や豊富なバックエンド対応(CUDA・ROCm・CPU等)から、産業利用でも広く採用されている。

by @tf_official
Related Topics: AI Machine Learning CUDA