同じハードウェアでLLMエージェントを最大2.39倍速く動かす「ThunderAgent」— KVキャッシュ競合を「プログラム」単位のスケジューリングで解消、ICML 2026 Spotlight採択
DRANK

7月29日、Together AIが「ThunderAgent: 2x Faster Agentic Inference for Synthetic Data Generation at Scale」と題した記事を公開した。エージェント型LLM推論において構造的に発生する「KVキャッシュスラッシング」問題を解決するシステム「ThunderAgent」を紹介するもので、シングルノードで約2.06倍、64GPU(8ノード)構成では2.39倍のスループット改善を実測で示している。本研究はジョージア工科大学・イリノイ大学アーバナシャンペーン校・カーネギーメロン大学・Together AIの共同研究としてICML 2026にSpotlight採択されており、すでにオープンソースとして公開済みだ。

by @tf_official
Related Topics: AI Machine Learning CUDA