LLM推論の「再計算コスト」をP2P転送で最大88%削減 — GPUを使わずノード間でKVキャッシュを共有するllm-dの新アプローチ
DRANK

8月15日、llm-d.aiが「Pull, Don't Recompute: Peer-to-Peer KV Cache Sharing in llm-d」と題した記事を公開した。この記事では、LLM推論クラスタにおいてKVキャッシュを再計算せずピア間で転送することで、スループットとTTFTを改善するP2Pキャッシュ共有の仕組みと実測結果について詳しく紹介されている。

by @tf_official
Related Topics: AI Machine Learning Kubernetes