本記事はAIを活用して自動収集・要約しています。サムネイルおよび画像もAIツールを使用して生成しています。
概要
Mistral AIは、コンテンツの安全性を判定するオープンウェイトの分類器モデル「Shieldstral」を発表しました。パラメータ数30億の多モーダルモデルで、テキストと画像の両方に対応します。ライセンスはApache 2.0で、16GBのNVIDIA GPU1枚で動作します。
モデルの特徴
Shieldstralは、コンテンツの安全性評価をポリシーに適応した質問応答タスクとして扱う点が特徴です。従来のガードレールモデルは有害カテゴリーの分類方法をモデルの重みに固定していましたが、Shieldstralは推論時に自然言語でポリシーを記述でき、再学習なしにテキストと画像の安全性評価を行えます。
判定は、以下3つの入力に基づいて行われます。
- Instruct:評価の文脈や厳密度などの指示
- Query:「暴力を助長しているか」といった単一の質問
- Document:判定対象のテキストや画像
推論時にはモデルが出力する「yes」「no」の確率から連続的な安全性スコアを算出します。
性能
Mistral AIによると、Shieldstralはテキストの安全性判定、拒否検出、ポリシーへの適応性、多モーダルの安全性判定という4つの評価軸において、パラメータ数が3倍から7倍大きい既存のオープンなガードレールモデルと同等以上の性能を示したとしています。
学習方法
Shieldstralは、公開されている安全性データセットの分類方法やラベル形式の違いを統一した形式に変換した上で学習されています。また、類似した紛らわしいポリシーの組を用意し、LLM(大規模言語モデル)に安全性に関するテキストを書き換えさせることで、モデルが暗記ではなく判別を学習できるようにしています。画像に関する安全性データが少ない点については、汎用の画像データセットを補完的に活用しています。
Open Secure AI Allianceとの関連
Mistral AIは、NVIDIAなどが参加する「Open Secure AI Alliance」の初期メンバーとして、Shieldstralをオープンウェイトで公開したとしています。
出典:Mistral AI「Introducing Shieldstral.」(2026年8月4日)https://mistral.ai/news/shieldstral









