AIエージェントが実業務をこなせるのは4件に1件だけ — UCバークレーの厳格なベンチマークが示す「自律AI」の現在地
DRANK

7月25日、PYMNTSが「AI Agents Fail 3 Out of 4 Real Job Tasks」と題した記事を公開した。UCバークレーが実業務タスクを用いた厳格なベンチマーク「Agents' Last Exam」でAIエージェントの実力を検証した研究を詳報している。現時点で最高スコアを記録したシステムでさえ正答率は**26%**にとどまり、難問カテゴリではAnthropicのClaudeが全問不合格という結果が示された。

by @tf_official
Related Topics: AI Machine Learning