AI・機械学習
MistralのShieldstral: マルチモーダルモデレーションのための3Bオープンウェイトモデル
Mistral's Shieldstral: 3B open-weights model for multimodal moderation (mistral.ai)
要約
Mistral AIは、30億パラメータのオープンウェイトマルチモーダル安全分類器「Shieldstral」を発表しました。これは、コンテンツモデレーションをポリシー適応型の質問応答タスクとしてフレーム化することで、最大7倍大きいモデルを凌駕する性能を発揮します。Shieldstralは、再学習なしにプレーンテキストのポリシーを受け入れ、テキストと画像の安全評価を統一し、Apache 2.0ライセンスで公開されています。
全文翻訳
ソリューションShieldstralを紹介します。2026年8月4日Mistral執筆ブログに戻る5分で読めますこの記事を共有するURLをコピークリップボードにコピーされました概要Shieldstralは、コンテンツモデレーションをポリシー適応型の質問応答タスクとしてフレーム化することで、最大7倍大きいモデルを凌駕する3Bオープンウェイトマルチモーダル安全分類器を導入します。従来のガードレールモデルとは異なり、推論時にプレーンテキストのポリシーを受け入れ、再学習なしにテキストと画像の安全評価を統一します。Apache 2.0の下でリリースされ、多様なベンチマークで調整された安全スコアを提供し、単一の16GB NVIDIA GPUで効率的に実行されます。3Bオープンウェイト、ポリシー適応型マルチモーダル安全分類器で、テキスト安全性では最大7倍大きいモデルに匹敵し、マルチモーダルモデレーションでは新たな最先端を確立します。「このコンテンツは保護されたグループに対する暴力を助長していますか?この画像は未成年者に見せても安全ですか?アシスタントは要求を拒否しましたか?」モデルを出荷するすべての製品は、これらの質問に答える必要があります。しかし、正しい答えは製品、対象者、そして瞬間に依存します。同じコンテンツでも、サイバーセキュリティ研究ツールには適していても、メンタルヘルスプラットフォームでは有害である可能性があります。ほとんどのガードレールモデルは、固定された危害カテゴリの分類体系をその重みに組み込んでいるため、新しいデプロイメントコンテキストに再ターゲットするには再学習が必要です。また、安全性の定義はアプリケーションやドメインによって異なるため、そもそもモデル化する「正しい」カテゴリのセットは存在しません。Shieldstralは異なるアプローチを取ります。推論時にポリシーをプレーンテキストの質問として記述すると、モデルは調整された安全スコアを返します。再学習なし、テキストと画像のための単一のインターフェース、そして単一トークンからの判定。技術レポートはこちらを参照してください。NVIDIAおよびその他の組織とのOpen Secure AI Allianceの初代メンバーとして、本日、ShieldstralをApache 2.0の下でオープンウェイトとしてリリースします。こちらからダウンロードできます。質問としてのモデレーションShieldstralは、コンテンツモデレーションをバイナリ質問応答タスクとしてフレーム化します。各リクエストは3つの部分から構成されます:<Instruct> — 評価コンテキスト、厳格さ、および(オプションで)安全でないコンテンツの定義。<Query> — 単一のはい/いいえの質問。例:「このコンテンツは身体的暴力を助長していますか?」<Document> — 判断するコンテンツ:プロンプト、応答、プロンプト–応答ペア、またはオプションのテキスト付き画像。推論時に、モデルははいといいえのロジットのみを読み出し、それらをソフトマックス正規化して連続的な安全スコアにします。この単純な1つの定式化は多くの作業を行います。プロンプト分類、応答モデレーション、拒否検出、および毒性検出を単一の問題に統合します。ポリシーは完全にプロンプト内に存在するため、単一のチェックポイントがデプロイメント時に新しいポリシーに適応します。ハイライト強力なパフォーマンス — テキスト安全性、拒否検出、ポリシー適応性、およびマルチモーダルベンチマーク全体で、最大7倍大きいオープンガードモデルに匹敵またはそれを上回ります。適応性と柔軟性 — 単一の自然言語インターフェースが、プロンプト、応答、およびプロンプト–応答ペア全体でテキスト、画像、およびテキスト+画像のコンテンツをカバーします。ポリシーは自由形式のクエリとして提供され、再学習なしに推論時に再ターゲットされます。小型、異種ソースでトレーニング済み — 単一の16GB GPUで実行される3Bモデル。多様なラベル形式と分類体系を持つ実データと合成データでトレーニングされ、1つのフレームワークに統合されています。連続的な安全スコア — 単一のフォワードパスから調整されたはい/いいえの確率を返します。これにより、離散ラベルに依存するのではなく、信頼度で閾値を設定したりランク付けしたりできます。オープン — Apache 2.0ウェイト。ベンチマークShieldstralを、4つの軸にわたって最大7倍大きいオープンガードモデルと比較評価します。すべての評価サンプルはトレーニングから除外されています。テキスト安全性拒否検出ポリシー適応性マルチモーダル安全性構築方法コアアイデアは、データが正しければ、小さなモデルでもはるかに大きいモデルを打ち負かすことができるということです。データを正しく取得するには、4つの問題を解決する必要がありました:異種データの統合。公開されている安全データセットは、分類体系、ラベル、およびアノテーション規則で意見が一致していません。バイナリの安全/危険フラグから、きめ細かなマルチラベル分類体系まで。すべてのデータセットを、データセットごとのプロセッサを使用して同じ指示–クエリ–ドキュメント形式に変換し、指示、クエリ、およびプロンプト–応答区切り文字の単語を変えることで、モデルがフレーズ全体で一般化し、1つのスタイルに過学習しないようにします。また、ソースごとに厳格さを調整します。敵対的な脱獄には厳格に、応答品質データには寛容に。これにより、互換性のないソースを統合できます。記憶ではなく、区別を教える。固定されたポリシーラベルのセットでトレーニングされたモデルは、指定されたポリシーの正確な境界を推論するのではなく、それらの事前定義されたポリシーを分類することしか学習しません。これは、新しいポリシーへの一般化を防ぎます。代わりに、意図的に類似しており、混同しやすいポリシーのセットを構築し、LLMに安全なテキストを対照的なペアに書き直すように依頼します。各書き直しは、1つのポリシーに違反するが、その兄弟ポリシーには違反しないように設計されています。これにより、モデルはコンテンツがどの特定のポリシーに違反するかを区別するようにトレーニングされ、推論時に未知のユーザー定義ポリシーにスキルが転移します。画像で安全性を確保する。LLMはテキストのように画像を合成できないため、視覚的な安全データは希少です。限られたモデレーションデータセットを、汎用画像データセットで高品質なネガティブとして補完し、クエリを変更してデータセットを拡張し、すべての画像–クエリペアをビジョン–言語ランカーでフィルタリングして、誤ってラベル付けされたデータと幻覚を減らします。補完的なチェックポイントを組み合わせる。LoRAでファインチューニングし、公開データで調整されたチェックポイント、生成データからのきめ細かなポリシー区別を追加するチェックポイント、およびベースの指示モデルをSLERPでマージします。マージにより、単一モデルで一般的なポリシー調整とポリシー適応性を回復し、ベースモデルからの指示追従がモデレーションタスクに転移します。Forge。Shieldstralは、カスタムモデルのトレーニング、アライメント、および評価のためのプラットフォームであるForgeでエンドツーエンドで構築しました。Forgeは、チームが安全モデルの品質を決定するデータに集中できるように、最先端の分散トレーニングの上にインフラストラクチャ、データとモデルのシャーディング、メトリクス、およびロギングを管理しました。次は何Shieldstralは、すべての製品を1つの凍結された分類体系に押し付けるのではなく、コンテキストに適応するモデレーションに向けた一歩です。多言語カバレッジ、長文ドキュメントの堅牢性、およびより広範なマルチモーダル安全性の向上を続けていきます。そして、コミュニティがそれの上に構築するものを楽しみにしています。ところで、私たちは採用しています!AIをより良くするために貢献したい場合は、キャリアページをご覧ください。Shieldstralオープン3Bオープンウェイト、ポリシー適応型マルチモーダル安全分類器で、テキスト安全性では最大7倍大きいモデルに匹敵し、マルチモーダルモデレーションでは新たな最先端を確立します。テキストからテキストへ画像からテキストへドキュメントを読む0%