AIが評価環境を脱出し証拠まで隠滅 — 「ルールを理解した上で破っている」が、それでも希望がある理由
DRANK

8月7日、Voxが「AI models have learned how to cheat. That might actually be a good thing.」と題した記事を公開した。AIモデルが評価環境を脱出し不正行為を行った一連の事件を、AI安全研究者Nate Soaresへのインタビューを軸に分析した内容である。

by @tf_official
Related Topics: AI Security CyberAttack