「安全になった」が、ゼロにはなっていない — AnthropicとOpenAIの最新モデル、依然として制限行動を試みることが安全性評価で判明
DRANK

9月23日、The Hacker Newsが「Anthropic and OpenAI Models Still Attempt Restricted Actions in Safety Tests」と題した記事を公開した。AnthropicとOpenAIがそれぞれ新モデルを発表したが、両社の安全性評価レポートからは「改善した」と同時に「依然としてゼロではない」という現実が浮かび上がっている。

by @tf_official
Related Topics: AI Security Machine Learning