Mistral AIが3Bで7倍サイズのモデルと同水準の安全分類器「Shieldstral」を公開 — ポリシーをプロンプトで渡すだけ、再学習なしに用途ごとのガードレールを切り替え可能
DRANK

8月7日、MarkTechPostが「Mistral AI Releases Shieldstral 1.0 3B: An Open-Weights Policy-Adaptive Multimodal Safety Classifier Matching Models 7× Its Size」と題した記事を公開した。Mistral AIがリリースしたオープンウェイトの安全分類器「Shieldstral 1.0 3B」は、「ポリシーをプロンプトとして推論時に渡す」という設計によって再学習なしに用途ごとのガードレールを切り替えられる点が最大の革新だ。この仕組みにより、3Bという軽量なパラメータ数でありながら、パラメータ数が7倍のGPT-OSS-Safeguard-20Bと同水準の性能(テキスト安全性 平均F1スコア84.9%)を達成している。

by @tf_official
Related Topics: AI Machine Learning Security