LLMベンチマークの「安全性スコア」は実は推論能力を測っていた — Ai2が100モデル・3万4千問を分析して判明したこと
DRANK

9月1日、Ai2が「BenchMIRT: What are LLM benchmarks actually measuring?」と題した記事を公開した。安全性評価用として設計されたベンチマーク「BBQ」が、安全性とはほぼ無関係(相関係数 -0.06)で、むしろ一般的な推論能力と 0.85 という強い相関を持つ——この驚くべき発見こそ、Ai2の新手法「BenchMIRT」が浮かび上がらせた実態だ。「何を測っているか」を謳ったベンチマークが、実際には別の能力を測っていたとすれば、これまでのLLM評価の解釈を根本から問い直す必要がある。

by @tf_official
Related Topics: AI Machine Learning Security