LLM分散推論のルーティング問題を「飽和したら手放す」一言で解決 — キャッシュ効率とロードバランシングを両立するllm-dの新デフォルト設計
DRANK

8月17日、llm-d.aiが「Sticky Until Saturated: Token-Aware Routing in llm-d」と題した記事を公開した。LLM推論インフラにおけるKVキャッシュ効率とロードバランシングの二律背反を、「閾値付き粘着性(sticky until saturated)」という一貫した原則で解消するトークン認識ルーティング手法の詳細と、その設計思想が解説されている。

by @tf_official
Related Topics: AI Machine Learning Distributed Computing