Claude Opus 5、「汎用推論力」測定ベンチマークでGPT-5.6 Solの約4倍スコアを記録 — ただし「ベンチマーク特化では?」の疑問も
DRANK

7月26日、The Decoderが「Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence」と題した記事を公開した。この記事では、AnthropicのClaude Opus 5がAGI能力の測定を目的とするベンチマーク「ARC-AGI-3」でトップスコアを記録し、GPT-5.6 Solを大幅に上回ったことについて詳しく紹介されている。

by @tf_official
Related Topics: AI Machine Learning Deep Learning