公式環境では7.8%、独自設定では38.3% — OpenAIがAI知能テストで「条件を変えて」Claude Opus 5超えを主張、設定次第でスコアが5倍になるベンチマーク競争の本質
DRANK

7月30日、The Decoderが「OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings」と題した記事を公開した。OpenAIがGPT-5.6 Solの独自API設定を用いてARC-AGI-3ベンチマークでAnthropicのClaude Opus 5を上回ると主張したものの、その評価手法の公平性に疑問が浮上している。

by @tf_official
Related Topics: AI Machine Learning