Sakana AIの「モデルルーター」が選択プールに含めないままAnthropicの最新モデルFable 5を超えたと主張 — 第三者検証なき数値をどう読むか
DRANK

7月24日、Matthias Bastianが「Sakana claims its AI model router Fugu Ultra v1.1 now beats Fable 5 without even including it in the pool」と題した記事を公開した。この記事では、Sakana AIのAIモデルルーター「Fugu Ultra v1.1」が、ルーターの選択プールに含まれていないAnthropicの最新モデル「Fable 5」を複数のベンチマークで上回ったとSakana AIが主張していることを詳しく紹介している。最も注目される点は逆説的な構図だ。「プールに加えていないモデルを、プール全体の組み合わせで上回った」という主張は、ルーティング戦略そのものの有効性を示す根拠として持ち出されている。ただし数値はすべてSakana AI自身によるもので、独立した第三者検証は存在しない。この構図をどう評価するかが、本記事全体のテーマになる。

by @tf_official
Related Topics: AI Machine Learning AI Text Generator