Mistralが「自然言語でポリシーを書くだけ」のAIコンテンツ審査モデルを公開 — 3Bパラメータで大規模モデルと同等以上のベンチマーク性能
DRANK

8月5日、SiliconAngleが「Mistral introduces Shieldstral to provide lightweight policy-aware moderation for AI models」と題した記事を公開した。フランスのAIスタートアップMistral AIが発表した軽量モデレーションモデル「Shieldstral」は、専用のリトレーニングなしに自然言語で書かれたポリシーをそのまま判定基準として使える点で、従来のコンテンツモデレーション手法とは一線を画す。「ランサムウェアの作り方」と「ランサムウェアの検知・防御の解説」を文脈ごとに区別して判定できる——そのような意味論的な識別能力を、30億パラメータ(3B)という軽量なモデルで実現したことが本発表の核心だ。

by @tf_official
Related Topics: AI Machine Learning Security