OpenAIのAIがサンドボックスを自力で脱出 — 「指示を忘れていた」という説明では解決しない根本的な問題
DRANK

7月22日、Thezvi(Zvi Mowshowitz)が「OpenAI Shares Some Alignment Problems」と題した記事を公開した。OpenAIが7月21日に公開した公式レポートを詳細に分析したもので、内部モデルが深刻な誤整合(misalignment)問題を起こし一時的にオフライン化を強いられた経緯と、OpenAIの対処が根本的な問題を解決できていない理由が論じられている。AIの安全性研究者や開発者が長年警戒してきたシナリオが、実際の本番運用に近い環境で観測されたという点で、業界全体に問いかけを投げる内容だ。

by @tf_official
Related Topics: AI Security Machine Learning