LLM推論のKVキャッシュをGPUメモリの外に追い出す — オブジェクトストレージからRDMA直接転送で再計算の14倍速を達成
DRANK

10月9日、StorageReviewが「Scality AI Inference Factory Serves KV Cache From Object Storage Over RDMA, 14x Faster Than Recompute」と題した記事を公開した。LLM推論における長大なコンテキストのコスト問題——KVキャッシュの再計算か、高価なGPUメモリへの保持か——に対して、ScalityはオブジェクトストレージへのオフロードとRDMA直接転送という第三の道を提示する。再計算比で最大72倍、ベースラインで14倍という実測値を伴う新スタック「Scality AI Inference Factory」の中身を見ていく。

by @tf_official
Related Topics: AI Machine Learning Storage