最高スコアのモデルでも職場タスクの合格率24% — UCバークレーの調査が示す「1.6兆ドル投資」と実力のギャップ
DRANK

7月22日、Futurismが「Frontier AI Is Faceplanting at Real-World Workplace Tasks」と題した記事を公開した。この記事では、最先端AIモデルが実際の職場タスクをほとんどこなせないことを示したUCバークレーの新たな調査結果について詳しく紹介されている。AIへの投資1.6兆ドル、職場での成功率は24%以下AIへの業界投資総額はすでに1.6兆ドルを超えた。しかし実態はどうか。UCバークレーの「Center for Responsible, Decentralized Intelligence(RDI)」が実施した調査によれば、現在の最先端AIモデルは職場タスクの大半を満足なレベルでこなせていない。これはOpenAIやAnthropicらが掲げる「AI革命は目前」という主張に、大きな疑問符を突きつける結果だ。「Agents' Last Exam」とは研究チームが設計したベンチマークの名称は「Agents' Last Exam(ALE)」。これはAIの学力測定で話題になった「Humanity's Last Exam」をもじったもので、...

by @tf_official
Related Topics: AI Machine Learning