AIのガードレールを「数分・無料」で大幅に無効化できる処理が存在する — テスト対象の5モデル中3モデルがテロ支援安全基準に不合格
DRANK

10月10日、Lauren Fichtenが「Researchers asked AI models to help with terrorist operations. Here's how they responded.」と題した記事を公開した。テロ攻撃を想定したプロンプトをAIモデルに与えた調査で、5モデル中3モデルが安全基準に不合格——そして安全スコア97点のモデルが、ある処理を施すだけで約3点に急落したという事実が最大の衝撃だ。

by @tf_official
Related Topics: AI Security Machine Learning