AmazonがAIエージェントを「実際の業務手順書」で評価するベンチマークを公開 — モデル更新で成功率が下がるケースも判明
DRANK

8月22日、amazon.scienceが「SOP-Bench: A new benchmark for evaluating AI agents on real business procedures」と題した記事を公開した。注目すべきは、モデルをバージョンアップしたにもかかわらず成功率が下がるケースが実験で確認された点だ。本番運用中のエージェントを持つチームにとって、見過ごせない知見が含まれている。

by @tf_official
Related Topics: AI Machine Learning