45のAIエージェントを評価したら満点ゼロ — 「できる」と謳うブラウジング自動化の実態
DRANK

9月3日、Craig Haleが「Research finds AI agents haven't quite mastered real-world browsing tasks despite claiming they can」と題した記事を公開した。この記事では、45のAIエージェントを対象にした実世界ブラウジングタスクの評価研究で、満点を達成したエージェントが1つもなかったという調査結果について詳しく紹介されている。

by @tf_official
Related Topics: AI Web Standards / Browsers Machine Learning