Mistral の Shieldstral:マルチモーダル検閲向けに公開された 3B オープンウェイトモデル

2026/08/05 1:36

Mistral の Shieldstral:マルチモーダル検閲向けに公開された 3B オープンウェイトモデル

RSS: https://news.ycombinator.com/rss

要約

日本語訳:

Shieldstral は、NVIDIA との Open Secure AI Alliance の初メンバーとして Apache 2.0 ライセンスの下でリリースされた、30 億パラメータを持つオープンウェイトのマルチモーダル安全性分類器です。このモデルは、テキストと画像の安全性評価を単一の適応型インターフェースに統合し、1 トークンから定量化された連続的な安全性スコアを返します。Shieldstral は、コンテンツモデレーションを文脈・厳格度に適応する質問応答タスクとして位置付け、推論時に再トレーニングなしで平易な言語でのポリシーを受け入れる 3 つのコンポーネント(:文脈/厳格度、:はい/いいえの安全性に関する質問、:評価対象のテキストまたは画像)を採用しています。Shieldstral は、プロンプト分類、回答モデレーション、拒否検出、毒性検出を単一の適応可能な問題に統合します。性能については、テキスト安全性、拒否検出、ポリシー適応性、マルチモーダルベンチマークにおいて、最大 7 倍のサイズを持つオープンガードモデルと同等かそれ以上の性能を示し、1 つの 16GB の NVIDIA GPU で効率的に動作します。Forge 上でのエンドツーエンドトレーニングでは、多様なラベル形式を持つ現実および合成データを組み合わせたヘテロ지니어ズなデータを使用し、以下の 4 つの主要な課題に取り組んでいます:(1)ヘテロ지니어ズなデータタクソノミーの統合、(2)暗記ではなく判別の学習、(3)画像に基づく安全性の根拠付け、(4)LoRA と SLERP メージを介した補完的なチェックポイントの組み合わせです。データ処理では、ソースごとの厳格度調整(ジャイルブレイク用は厳しく、回答品質用は緩い)を行い、定量化された意思決定境界を学習し、一般的な画像データセットを負例として使用するとともに、視覚・言語再ランク付けにより誤ラベル付けされたペアをフィルタリングしました。今後の計画としては、多言語対応の拡大、長文書に対する堅牢性の向上、およびマルチモーダル安全性機能の幅広化が含まれます。

本文

Shieldstral:ポリシー適応型の安全評価モデルを公開

Shieldstral は、コンテンツモデレーションを**「ポリシー適応型の問答タスク」**として再定義する、30 億パラメータ級のオープンウェイト多モーダルモデルです。

  • 高性能:最大 7 倍の規模を持つモデルを上回る性能を発揮します。
  • 柔軟性:推論時に平易な言語で記述されたポリシーを受け入れ、再トレーニング不要でテキストと画像双方の安全評価を統合します。
  • オープンライセンスApache License 2.0 のもとでリリースされ、単一の 16GB NVIDIA GPU 上で効率的に動作します。
  • アクセス:Open Secure AI Alliance の初代メンバーとして、ダウンロードはこちらから で利用可能です。

なぜ「問答タスク」なのか?

従来のガードレール型モデルは内部の重みに固定された危害カテゴリーを組み込んでおり、新たなコンテキストへの対応には再トレーニングが必要です。しかし、安全の定義はアプリケーションやドメインによって異なります(例:サイバーセキュリティツールでは許容される内容も、メンタルヘルスプラットフォームでは有害と判断される場合がある)。

Shieldstral は以下のアプローチを採用しています:

  • 推論時のポリシー適用:ポリシーを「平易な言語の質問」として記述し、モデルから定量化された安全スコアを取得します。
  • 一元化されたインターフェース:テキストも画像も一つのインターフェースで対応可能であり、単一のトークンから結論(verdict)が得られます。

モデレーションを「問答」と見なす仕組み

Shieldstral はコンテンツモデレーションを二値的な問答タスクとして定式化し、各リクエストは以下の 3 つの要素で構成されます。

リクエストの構成要素

  • <Instruct>
    (指示)
    :評価の文脈、厳格さの設定、および「unsafe」とみなされる定義を含みます。
  • <Query>
    (質問)
    :単一のはい/いいえ形式の質問です。
    • 例:「このコンテンツが身体的暴力を促進しているか?」
  • <Document>
    (ドキュメント)
    :判断対象となるコンテンツです。
    • プロンプト、レスポンス、ペア、あるいは画像(テキスト付きオプション)などが該当します。

推論プロセス

  1. モデルは「はい」と「いいえ」の logits のみを読み出します。
  2. これらをソフトマックス正規化して連続的な安全スコアに変換します。

この単純な定式化により、プロンプト分類、レスポンスモデレーション、拒否検出、毒性検出といった複数のタスクを一元的に扱いつつ、ポリシーを完全プロンプト側で記述するため、デプロイ時に新しいポリシーにも即座に適応可能です。

ハイライト機能

  • 高い性能
    • テキスト分野の安全性、拒否検出、ポリシー適応性において、最大 7 倍の規模を持つオープンソースモデルと同等以上の結果を出します。
    • 多モーダルベンチマークでもトップクラスのスコアを獲得しました。
  • 適応性と柔軟性
    • 単一の自然言語インターフェースでテキスト、画像、およびそれらの組み合わせを網羅します。
    • ポリシーは自由形式の質問として提供され、推論時に再調整されるため、再トレーニングなしで新たなタスクに適応可能です。
  • 小規模だが多様なデータ基盤
    • 実世界データと合成データを組み合わせ、多種多様なラベル形式を一つの枠組みに統合しました。
    • 30 億パラメータモデルでありながら、単一の 16GB GPU で動作可能です。
  • 連続的な安全スコア
    • 離散ラベル(0/1)ではなく、定量化された確率を返すため、閾値設定やランク付けの信頼度に基づいた判断が可能になります。
  • オープンなライセンス
    • Apache License 2.0 のウェイトを公開しています。

ベンチマーク評価結果

我々は Shieldstral を、最大で7 倍の規模を持つオープンソースガードモデルと比較するために、以下の軸に沿って評価を行いました。

  • すべての評価サンプルはトレーニングデータから除外されています。
  • テキスト分野においては最大 7 倍の規模を持つモデルと同等の結果を達成しました。
  • 多モーダルモデレーション分野では新たな最高性能を確立しました。

開発プロセス:小規模モデルがなぜ勝つのか?

基本的な考え方は、「適切に選ばれたデータがあれば、小規模なモデルでもより大きなモデルを凌駕できる」です。データを正しく設定するために以下の 4 つの課題を解決しました。

1. 多様なデータの統合

  • 標準化:カテゴリ体系やラベルが異なる公開データセットを、同一の「指示–質問–ドキュメント」形式に変換しました。
  • 一般化促進:指示語句や区切り記号を変化させ、モデルが特定のスタイルに過学習するのを防ぎます。
  • 厳格さの定量化:ソースごとに厳格さを数値化(例:セキュリティ対策は厳しく、レスポンス品質データは緩やかに)し、定量的な意思決定境界を学習させました。

2. 判別能力の強化と暗記防止

  • 対照ペア学習:モデルを固定ポリシーだけでなく、似ていて混同しやすいポリシーセットでトレーニングします。
  • 再記述指示:安全なテキストを「違反する側」と「違反しない側」の兄弟ポリシーとして再記述させ、モデルがどのポリシーに違反しているかを識別する能力を持たせました。
  • 転移学習:ユーザー定義の未見ポリシーにもこの判別能力が転移します。

3. 画像における安全評価の定着

  • データ拡張:限られたモデレーションデータに加え、汎用的な画像データを高品質な負例として追加しました。
  • フィルタリング:すべての「画像–質問」ペアをビジョン–言語再ランクナーでフィルタリングし、誤ラベル付けやハルシネーションを削減しています。

4. チェックポイントの補完的融合

  • LoRA と SLERP 法を用いて以下の 3 つを融合させました。
    1. 公開データで定量化されたチェックポイント。
    2. 生成データから得られた細かいポリシー判別能力を持つチェックポイント。
    3. ベースの指示モデル。
  • これにより、共通するポリシー定量化と適応性を回復させつつ、ベースモデルからの指示追従性も保持しました。

5. エンドツーエンド開発(Forge プラットフォーム)

  • Shieldstral はすべて独自プラットフォーム Forge 上で開発されました。
  • トレーニング、アライメント、カスタムモデル評価のインフラストラクチャを提供し、分散トレーニング技術を活用しています。
  • チームはデータの質に集中でき、それが安全モデルの品質を決定づける重要な要素となりました。

今後の展望

Shieldstral は、すべての製品を一元的なカテゴリー体系で縛るのではなく、文脈に適応するようモデレーションを進めるための一歩です。

今後取り組む主要な課題:

  • 多言語対応の強化
  • 長文書に対する堅牢性の向上
  • より広い範囲の多モーダル安全性の確保

コミュニティがこれを用いてどのような新たな価値を生み出すかを見守るほか、現在採用活動も行っております。AI の向上に貢献したい方はキャリアページをご確認ください。

同じ日のほかのニュース

一覧に戻る →

2026/08/05 7:01

インターポールが警告、アフリカのサイバー犯罪の半分以上を AI が支えデジタル詐欺急増

## 日本語訳: 以下に、元の草案から欠落していた特定の地域的なニュアンスおよび文脈源をより適切に統合しつつ、明瞭さを維持するためにもたらされた改善されたバージョンが示されます。 ## サマリー(改善版) INTERPOL の 2026 アフリカサイバー脅威評価によると、人工知能はアフリカ全体でサイバー犯罪における支配的な力となり、報告された事例の半分以上を原動力とし、2024 年の 1,9200 万ドルから 2025 年には 4,8400 万ドルへと金融損失を増大させています。状況は地域によって多様です:西アフリカおよび南部アフリカは主要な詐欺センターを擁しており(調査対象国の 72% で特定)、中央アフリカではビジネスメールへの侵害やロマンス詐欺の発生率が高く、東アフリカではモバイルマネー詐欺、重要インフラに対するランサムウェア攻撃、合成アイデンティティ犯罪に苦しんでいます。特定のセックス extortion の急増が明らかで、TrendAI がディープフェイクに関連する約 60 万件の事例を検出しています。犯罪者はこれらのツールをソーシャルメディアやモバイルマネーおよびデジタル銀行のようなプラットフォームと組み合わせ、ローンの目的や SIM カード登録のために合成アイデンティティを伴う複雑なスキームを実行するために使用します。しかし、依然として重大な脆弱性が存在しており、特に南部アフリカのように高度なデジタル接続を有する国々において、銀行、通信事業者および法執行機関間の弱い連携は、犯罪者が盗まれた資金を瞬時に国境を超えて移動させることを可能にしています。これらの課題にもかかわらず、対応は増えつつあります;2025 年だけでも、セネガルの新しいオンライン報告プラットフォームを含むサイバー犯罪法の更新を行ったアフリカ諸国は 17 カ国あり、Serengeti 2.0 など共同作戦を促進し、それらは 1,500 件以上の逮捕と 1 億ドル以上の資金の回復をもたらしました。将来のセキュリティは、これらの進化する AI 駆動型の脅威に対処するために、持続的な国際協力および強化された地域準備に依存します。

2026/08/05 0:16

Show HN: 肌の色調を多様化する単純なアルゴリズムと色彩空間

## Japanese Translation: このプロジェクトは、デジタルアートおよびキャラクター作成向けに包摂的なツールを促進することを目的とした、簡略化された RGB ベースの色空間を導入します。これは、現在のシステム(絵文字:5 色、メイクアップパレット:約 50 色など)の限界に対処するものです。本モデルは、生物学的要因(メラニンや血流など)、個々のバイアス、健康状態(例:黄疸など)、および異なるディスプレイ環境によって複雑化している人間の肌トンの莫大な複雑性に対する科学的権威を主張するのではなく、実用的で「十分良好な」エンジニアリングの起点を優先します。手法は、手動での RGB データラベリング、主成分分析(PCA)によるデータセットの変換、Desmos 3D、SymPy、matplotlib、scikit-learn などのツールを用いた球面式のフィッティングを含みます。得られたシステムは、PCA 軸から導かれる 3 つの独立した値を利用し、UI を介して調整されます。ここで、可変的な球半径パラメータは色の変化を制御します;具体的には、この半径を小さくすると、すべての肌トーン(深肤色、白人、冷色調、温色調)において一様に変化が減少し、特定のグループを不均衡に排除することはありません。原点点はニュートラルな曖昧なトーンを表し、マッピングバイアスを特定するために有用です。今後の作業では、専門家ラベラーを用いてモデルを微調整し、黄疸や白斑症などの状態に対する簡略化された表現を取り入れる予定です。本アプローチは科学的でないことを認める一方で、エンジニアリング用途においては依然として非常に機能性を備えていることを認識しています。

2026/08/05 3:29

ダラスのウェイモ

## Japanese Translation: ウェイモは、ダラスで一般大衆への完全自動運転のライドヘイリングサービスの展開を正式に発表しました。今日から誰でもアプリをダウンロードし、乗車を注文できるようになっています。2 月よりサービスを開始以來自動運転待機リストに登録した約 15 万人の利用者がこのサービスを体験しており、現在はすべてのダラス住民に対して開放され、従来の待機リスト限定のアクセスは終了しました。本プログラムでは引き続き、ダラス・ラヴフィールド空港ターミナルでの完全自動運転試験が行われており、間もなく旅行者を乗せる予定となっています。また、ウェイモは近日中にダラスの高速道路上でも完全自動運転の試験を開始する見込みであり、これが公衆向けのライド利用に向けた当該路線の開放への最終段階となります。この拡大は、運転能力が制限される疾病を持つ人々にとって不可欠な自立性を提供します。エпилепシー・フェンデーション・テキサスの CEO クリス・ジャストル氏は、「画期的な前進」と評し、自動移動手段をテキサス全州に導入するための誇りあるパートナーシップについて言及しました。新たな機能により、利用者は間もなく運転免許証を必要とせず、身体的制約に直面することなく通勤したり用務を行ったり、社会的な外出を楽しむことができるようになります。

Mistral の Shieldstral:マルチモーダル検閲向けに公開された 3B オープンウェイトモデル | そっか~ニュース