GPT-6 Astraを「前世代モデルと同等」と評価したベンチマーク機関、批判を受けてスコアを修正 — LLM評価の信頼性問題が表面化
DRANK

9月6日、The Decoderが「Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism」と題した記事を公開した。Epoch AIが267モデル中1位(169点)と評価したGPT-6 Astraを、別の評価機関Artificial Analysisが「前世代モデルと同等」と判定していた——この食い違いが、LLMベンチマーク評価の信頼性問題を改めて可視化した。批判を受けたArtificial Analysisは、Intelligence IndexをバージョンをIntelligence Index v4.2へと刷新し、AstraのスコアやベンチマークセットそのものをAstraの評価を見直した。GPT-6 Astraの「過小評価」が刷新のきっかけ今回の更新の背景には、明確な批判があった。Artificial AnalysisはOpenAIの最新モデルGPT-6 Astraを、旧バージョンのインデックスで前世代モデルであるSol(GPT-6 Astraのひと...

by @tf_official
Related Topics: AI Machine Learning