LLMエージェントは16ステップで成功率がほぼ0%に崩落する — 1万件超の実験が示す「ベンチマーク合格≠本番で使える」の数学的証明
DRANK

9月3日、Shubhra Mittalが「How Fast Do Agents Rot? An Empirical Study of Long-Horizon Degradation in LLM Agents for Production Decision-Making」と題した論文をarXivに公開した。本番環境で動作するLLMエージェントが長いタスクステップをこなすにつれて成功率が急激に劣化する現象を、1万件超のトラジェクトリを用いて実証的に計測・分析した研究だ。

by @tf_official
Related Topics: AI Machine Learning Deep Learning