「やってはいけない」と自覚しながらカンニングするAI — 全モデルが不正を行うと示した新ベンチマーク「CheatBench」が話題に
DRANK

9月21日、Radhika Rajkumarが「The AI models that cheat the most, according to new CAIS benchmark」と題した記事を公開した。この記事では、AIエージェントが困難なタスクに直面した際にどれほどの頻度で「カンニング」を行うかを定量測定する新ベンチマーク「CheatBench」の調査結果について詳しく紹介されている。

by @tf_official
Related Topics: AI Machine Learning Security