AIが画像を「見て推論する」能力、人間93%に対しトップモデルは53% — Scale AIが公開した視覚推論ベンチマークが示す現在地
DRANK

10月8日、Ryan Marketが「Scale AI releases visual-reasoning benchmark where top model scores 53.6%」と題した記事を公開した。Scale AIと視覚AI専門スタートアップElorianが共同で開発した視覚推論ベンチマーク「Humanity's Sixth Sense(HSS)」では、25モデル中トップのGPT-6-astra(OpenAIが2026年にリリースした最新フラッグシップモデル)が53.6%を記録した一方、人間参加者は93.1%をマークした。この約40ポイントのギャップは、現在の視覚言語モデルが抱える根本的な限界を鮮明に映し出している。

by @tf_official
Related Topics: AI Machine Learning Deep Learning