SupabaseがAIコーディングエージェントを本番環境で採点するベンチマークを公開 — Claude CodeとCodexではドキュメント参照ページ数に約4倍の差
DRANK

8月1日、Michal Sutterが「Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks」と題した記事を公開した。SupabaseがClaude Code・Codex・OpenCodeなどのAIコーディングエージェントを実際のSupabaseタスクで評価するオープンソースベンチマーク「Supabase Evals」を公開したこと、そして評価を通じてエージェント間でドキュメント参照ページ数に約4倍の差があることが判明した点が注目を集めている。

by @tf_official
Related Topics: AI Docker AI Code Generator