DeepSeek-V4-ProがMicrosoftの推論特化AIに12戦全勝 — 分岐点は「賢さ」ではなく指示への追従精度だった
DRANK

8月2日、Runtime Wireが「Head to head: DeepSeek-V4-Pro vs Phi-4-reasoning」と題した記事を公開した。DeepSeek-V4-ProとMicrosoftのPhi-4-reasoningを12タスクで直接対決させた実用的ベンチマークの結果で、スコアは105.5対33.0と一方的な差がついた。注目すべきは敗因の中身だ。Phi-4-reasoningが劣っていたのは推論能力ではなく、「指示通りの成果物を返す」というプロダクト規律の部分だったと記事は結論づけている。

by @tf_official
Related Topics: AI Machine Learning Git