頂上決戦! effort=max同士の対決でGPT-5.6はClaudeに勝てるのか(React習熟度ベンチマーク)
DRANK
皆さんこんにちは。React習熟度シリーズの12記事目です。今回は、前回予告した通り、effort=maxでのGPT-5.6のベンチマーク結果をお伝えします。前回の記事では、GPT-5.6 Solの総合スコアがClaude Sonnet 5程度で、Claudeの上位モデルには届いていないことを明らかにしました。そのため、effort=maxでの挽回が可能かどうかが注目されていました。前回の記事はこちらです。 Sol80.1876.95+3.23GPT-5.6 Terra76.6973.44+3.26GPT-5.6 Luna78.1576.49+1.67SolとTerraはeffort=maxでそれぞれ3ポイント以上の伸びを見せましたが、Lunaは1.67ポイントの伸びにとどまりました。これにより、effort=highでは拮抗していたLunaとSolの差が開きました。Terraに関しては、元が低すぎたため、effort=maxでもLunaに負けています。Claudeのモデルと比較すると以下のような序列になります。モデルeffortスコアFable 5max86.67Opus 4.8max84.03Fable 5high81.33GPT-5.6 Solmax80.18Opus 4.8high79.38Sonnet 5high78.2GPT-5.6 Lunamax78.15GPT-5.6 Solhigh76.95GPT-5.6 Terramax76.69GPT-5.6 Lunahigh76.49Opus 4.7high75.7GPT-5.6 Terrahigh73.44結論として、effort=maxでの比較をしても、GPT-5.…