AIXC - AI Experience Center

Mistral AI、コンテンツ安全性を判定するオープンウェイトモデル「Shieldstral」を発表

Mistral AI、コンテンツ安全性を判定するオープンウェイトモデル「Shieldstral」を発表
AIセキュリティ LLM
2026.08.04

本記事はAIを活用して自動収集・要約しています。サムネイルおよび画像もAIツールを使用して生成しています。

概要

Mistral AIは、コンテンツの安全性を判定するオープンウェイトの分類器モデル「Shieldstral」を発表しました。パラメータ数30億の多モーダルモデルで、テキストと画像の両方に対応します。ライセンスはApache 2.0で、16GBのNVIDIA GPU1枚で動作します。

モデルの特徴

Shieldstralは、コンテンツの安全性評価をポリシーに適応した質問応答タスクとして扱う点が特徴です。従来のガードレールモデルは有害カテゴリーの分類方法をモデルの重みに固定していましたが、Shieldstralは推論時に自然言語でポリシーを記述でき、再学習なしにテキストと画像の安全性評価を行えます。

判定は、以下3つの入力に基づいて行われます。

  • Instruct:評価の文脈や厳密度などの指示
  • Query:「暴力を助長しているか」といった単一の質問
  • Document:判定対象のテキストや画像

推論時にはモデルが出力する「yes」「no」の確率から連続的な安全性スコアを算出します。

性能

Mistral AIによると、Shieldstralはテキストの安全性判定、拒否検出、ポリシーへの適応性、多モーダルの安全性判定という4つの評価軸において、パラメータ数が3倍から7倍大きい既存のオープンなガードレールモデルと同等以上の性能を示したとしています。

学習方法

Shieldstralは、公開されている安全性データセットの分類方法やラベル形式の違いを統一した形式に変換した上で学習されています。また、類似した紛らわしいポリシーの組を用意し、LLM(大規模言語モデル)に安全性に関するテキストを書き換えさせることで、モデルが暗記ではなく判別を学習できるようにしています。画像に関する安全性データが少ない点については、汎用の画像データセットを補完的に活用しています。

Open Secure AI Allianceとの関連

Mistral AIは、NVIDIAなどが参加する「Open Secure AI Alliance」の初期メンバーとして、Shieldstralをオープンウェイトで公開したとしています。


出典:Mistral AI「Introducing Shieldstral.」(2026年8月4日)https://mistral.ai/news/shieldstral

おすすめコンテンツ

Microsoft、社内のCopilot利用にAIトークン予算を導入──GPT-5.6 Solを既定モデルに設定

GitHub CopilotLLM
2026.08.06

Meta、コンシューマー端末で動くオープンウェイトモデル「Muse Glimmer」を公開——ザッカーバーグ氏の「パーソナルインテリジェンス」構想を体現

AIエージェントLLM
2026.08.10

OpenAI、サイバーセキュリティ支援プログラム「Daybreak」を拡大——新モデル「GPT-5.6-Cyber」も投入

AIセキュリティセキュリティ対策
2026.08.10

OpenAI、未解決の数学問題10件を解いた次世代モデル「Astra」を発表

LLM
2026.08.01

欧州委員会、8月2日からAI法の本格執行を開始——透明性義務も新たに適用

AIセキュリティ
2026.07.31

Anthropic、新モデル「Claude Opus 5」を発表——最先端性能を半額のコストで実現

AnthropicLLM
2026.07.24

アリババ、「最も強力」なAIモデル『Qwen3.8-Max』発表で株価上昇——米中のAI覇権争いが激化

LLMAnthropic
2026.08.03

Anaconda、AIセキュリティ企業Enkrypt AIを買収——エージェント・MCPサーバの脆弱性に対応

AIセキュリティAIエージェント
2026.08.04

OpenAI、ChatGPTの「GPT-5.6 Sol」を改善——無料ユーザー向けに「GPT-5.6 Luna」の提供を拡大

LLM
2026.08.06

Meta、ターミナル型コーディングエージェント「Muse Code」と新モデル「Muse Spark 1.2」を発表

AIエージェントLLM
2026.08.05

Microsoft、社内のCopilot利用にAIトークン予算を導入──GPT-5.6 Solを既定モデルに設定

GitHub CopilotLLM
2026.08.06

Meta、コンシューマー端末で動くオープンウェイトモデル「Muse Glimmer」を公開——ザッカーバーグ氏の「パーソナルインテリジェンス」構想を体現

AIエージェントLLM
2026.08.10

OpenAI、サイバーセキュリティ支援プログラム「Daybreak」を拡大——新モデル「GPT-5.6-Cyber」も投入

AIセキュリティセキュリティ対策
2026.08.10

OpenAI、未解決の数学問題10件を解いた次世代モデル「Astra」を発表

LLM
2026.08.01

欧州委員会、8月2日からAI法の本格執行を開始——透明性義務も新たに適用

AIセキュリティ
2026.07.31

Anthropic、新モデル「Claude Opus 5」を発表——最先端性能を半額のコストで実現

AnthropicLLM
2026.07.24

業界・規模問わず実績5,000社以上、
まずはお気軽にご相談ください

技術活用に役立つ情報や
サービス資料を公開しています

資料請求

相談しやすいスペシャリストが
お悩みに対応します

お問い合わせ

お電話でもお問い合わせできます
(平日9:30〜18:30)

0120-991-668