
2026/08/02 0:23
探検的モデリング:K の推論の最良の結果を学習に使用する
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
探索的モデリング(XM)は生成 AI に対して変革的なパラダイムを提示し、従来のデータスケーリングおよびパラメータ最適化とは区別される第 3 の事前学習の軸として確立されます。現在の単一トークン予測に制限された自己回帰モデルが、多様な回答を「平均的なぼやけ」に収斂させるという問題に対し、XM は訓練を K つの可能な対応候補ごとに分解し、各ステップで最良の一致からのグラディエントのみを使用します。このアプローチは、アーキテクチャの変更やハイパーパラメータの調整を要することなく、生成表現力を劇的に向上させます。結果は大きな効率性の向上を示しています:XM は既存の方法に比べてサンプル使用量を 6.2 倍、FLOP 効率を 4.1 倍、パラメータ効率を 47%改善します。具体的には、XM は制御タスクにおいて拡散モデルの能力と同等の性能を発揮しながら、推論計算リソースを最大 256 倍削減します(ポリシーは前方伝播 1 回のみで済む一方、Diffusion Policy では 100 回必要)。また、収束速度はほぼ 300 倍速くなります。効率性の向上に加え、XM は目標をノイズの多い記憶ではなく一貫性のあるものとして設定することで過学習を減少させ、探索を行わない場合の最良の FVD の 37.5 から 30.0 に改善します。標準的な単一トークン LLM への即座の決定的進歩は限定的かもしれないが、この技術は高解像度ビデオ生成(20%以上の向上)などの複雑なマルチモーダルタスクに対して堅牢な新たなレシピを提供し、業界におけるマルチトークン予測や潜在条件付けなどにおいて大きな有望性を示します。
本文
探索的モデリング:第 3 の事前学習軸とエンドツーエンドな生成の解放
1. 概要 (TLDR)
この研究では、既存の生成モデルに追加することで第 3 の事前学習軸となり、かつエンドツーエンドな生成を可能にする新たなパラダイムである「探索的モデリング(Explorative Modeling)」を導入します。主な特徴は以下の通りです。
- 性能の向上: 画像、ビデオ、言語を含むすべての既存モデルで、探索の度合いを増やすことで一様に性能が向上し、その効果はスケーリングに伴いさらに増大します。
- データ量による利点:7% から 36% に増加
- パラメータ数による利点:13% から 23% に増加
- 効率性の劇的改善: 探索的モデル(XMs)は以下の効率を大幅に向上させます。
- サンプリング効率:6.2 倍の向上
- FLOP 効率:4.1 倍の向上
- パラメータ効率:47% の向上
- エンドツーエンドな生成: XMs は制御タスクにおいてディフュージョンモデルと同等のパフォーマンスを発揮しつつ、推論時の計算資源を最大で 256 倍削減できます。
2. 問題の所在:なぜ直接予測は機能しないのか
2.1 直接的な回帰の失敗
- 「犬を生成せよ」と命じられたとき、正しい答え(画像)は数十億枚存在します。
- 神経ネットワークを直接犬の画像を予測するよう訓練すると、モデルは学習中の数千頭の異なる有効な犬を見てしまいます。
- モデルが学ぶ結果は平均値になりますが、数千頭の犬の平均像は犬ではなく、単なる茶色のぼやけた影になってしまいます。
[実際の犬] -> データ ↓ [モデルの予測] -> 茶色のぼやけ (平均値) *(図 1: 直接的な回帰ではデータと類似しない不良な答えが得られる)*
2.2 ダーツボードゲームによる説明
- ゲームのルール: ダーツを投げ、次の着地点を推測する。推測とのズレほどスコアが悪い(損失最小化)。
- 直感的な結論: エラーを最小化するにはボードの中央(平均値)を推測するのが最適に見える。
- 現実: ダーツが実際に落ちる場所は中央にほとんどありません。「最適」な推測は、ダーツが決して落ちない場所です。
- 結論: 予測に対して多数の有効な答えが存在する場合、単一の予測を平均化するのは誤りであり、あらゆるデータタイプ(画像、テキストなど)でこの問題が発生します。
2.3 既存モデルの解決策:生成因子化 (Factoring Generation)
- ChatGPT や画像生成モデルはこの問題を生成プロセスを小さなステップに分割することで解決しています。
- 自己回帰モデル: 一度に 1 つの要素のみを予測(例:「左右」を決めた後、「上下」を決定)。選択肢が狭まり、平均化が回避されます。
- ディフュージョンモデル: 純粋なランダムノイズから数百の微小ステップを踏み、徐々に可能性を狭めます。
*(図 5: 自己回帰は配列要素を 1 つずつ予測し、選択肢を絞る)* *(図 6: ディフュージョンはノイズからデータへ向かって微細ステップを踏む)*
2.4 課題:生成因子化の欠陥
このアプローチには重大な問題があります。
- 曝露バイアス (Exposure Bias):
- 訓練時に数百〜数千のステップを実行するが、推論時には単一ステップのみで完結する。
- 不完全な出力が入力としてフィードバックされ、誤差が累積して生成結果が逸脱する(例:ビデオモデルが途中で溶ける)。
- エンドツーエンドではない:
- 訓練時と推論時の挙動が一致しないため、真のエンドツーエンドモデルとは言えません。
- 深層学習の教訓(AlexNet)に従い、モデルをデータから直接全て学習させる方が優れています。生成モデリングだけがこの例外です。
3. 解決策:探索的モデリング (Explorative Modeling)
3.1 アイデア:学習ループの因子化
- 「生成」と「訓練」にのみプロセスがあり、「生成は不可能なら、残るのは学習ループである」。
- アイデア: 学習ループ自体を因子化する。
- 1 つの推測ではなく、20 個の推測を与え、最も近いものだけをカウントするルールに変更する。
3.2 モード強制 (Mode Forcing) と探索的モデル (XMs)
- メカニズム: 各訓練ステップにおいて、モデルは生成物と実際のデータの間の K 個の候補マッチを探求し、その中で最も良いものだけが訓練されます。
# 簡易コード例:モード強制 losses = [] for i in range(K): generation = model.generate() # 別のランダムノイズから生成 losses.append(loss_fn(generation, data)) min(losses).backward() # 最も良い生成物だけが勾配を受ける
- 効果: K を増加させることで、損失最小化点は「データの平均」から「データ自体(複数のモード)」へと移動します。これを**モード強制 (Mode Forcing)**と呼びます。
*(図 8: 探索の増加は平均をリアルなものに変換する)* K=1 -> ぼやけ (平均) K>1 -> リアルな画像 / "the the the" (複数モード)
3.3 生成表現力 (Generative Expressivity)
- K はモデルがどの程度の異なる答えにコミットできるかを制御します。
- K=1: 平均化(ぼやけた影)
- K>1: 複数の有効な答えを捉える(20 つの異なる答え)
- 重要: これまでの研究では、パラメータ数とデータ量がボトルネックとして注目されてきましたが、「生成表現力」はこの第 3 の軸でありながら見過ごされてきました。探索はこれをスケーリング可能なものに変えます。
4. 実証結果:効率性と一般化能力の向上
既存モデルに XMs を追加することで、以下の劇的な改善が見られました。
4.1 画像生成 (ImageNet) の性能向上
- RAE レシピ:
- 必要なデータ量:6.2 倍削減
- FLOP: 4.1 倍削減
- RAE と同等の最終性能達成(FID 1.43)
- SiT ベースライン:
- 計算資源:抑えた上で、必要データ量2.5 倍削減
- FLOP 効率:最大 52% 向上
*(図 10: 少ないデータと FLOP で SOTA に到達)* *(図 11: SiT ベースラインでの効率化)*
4.2 スケーリング効果
- 探索による利得はスケーリングに伴い増大します。
- データ量が増えるにつれ、利点は 7% → 36% に増加。
- モデルが大きくなるにつれ、利点は 13% → 23% に増加。
- これにより、固定された「生成表現力」がボトルネックとなっている大規模モデルの性能制限を緩和できます。
*(図 13: スケールとともに探索による利得が増加)*
4.3 一般化能力 (Generalization) の向上
- 追加の訓練計算資源は直接、一般化能力を購入します。
- より多くの探索を持つモデルは、固定データセットでの過学習を軽減。
- FVD: 37.5 → 30.0 (無探索時の最良値 vs 探索あり)
*(図 14: 過学習の軽減と性能向上)*
5. エンドツーエンドな生成の実現
5.1 推論コストの劇的削減
- 既存モデルは推論時に多数の生成ステップ(因子化)が必要でしたが、XM は訓練中に表現力を支払うため、推論時は単一フォワードパスで十分です。
| タスク | ディフュージョンポリシー (既存) | 探索的ポリシー (XM) | リストアップ (Lift) |
|---|---|---|---|
| フォワードパス数 | 100 | 1 | - |
| キャノンボール | 100% | 100% | - |
| 輸送 (Transport) | 94% | 96% | +2.6% |
5.2 ワールドモデルにおける成果
- 目標条件付けされたワールドモデリングにおいて、XM は Diffuser よりも圧倒的に効率的です。
| メトリック | Diffuser (既存) | 探索的ワールドモデル (XM) | 改善率 |
|---|---|---|---|
| スコア (平均) | 127.2 | 130.0 | +2.2% |
| フォワードパス数 (平均) | 192 | 2.3 | -98% |
5.3 行動クローンタスクでの比較
- XM は単一のフォワードパスで、100 パス必要なディフュージョンと同等の結果を達成。
| 方法 | フォワードパス数 | リフト (Lift) | キャノンボール | 輸送 | ツールハンギング |
|---|---|---|---|---|---|
| ディフュージョンポリシー | 100 | 100% | 100% | 94% | 72% |
| 探索的ポリシー (XM) | 1 | 100% | 100% | 96% | 74% |
*(図 9: 既存モデルは生成を因子化。対照的に XM は訓練を因子化し、推論時をシンプルにする)*
6. アドビションと将来展望
6.1 適用の容易さ
- アーキテクチャ変更不要: 既存のモデル(画像・ビデオ・言語等)に擬似コード(for ループ)を追加するだけで可能。
- 汎用性: 多様なデータセットやドメインで FLOP 効率、データ効率、一般化能力の向上を確認済み。
- 判断基準: モデルの各予測が多くの有効な答えに直面しているほど(マルチモーダル性が高いほど)、探索からの恩恵は大きくなります。
6.2 LLM への適用可能性
- 現状: 長いコンテキストから次のトークンを予測する場合、ほぼ 1 つの答えしかなく、即座的成功は限定的です。
- 将来: データ効率への早期利得が確認されており、多トークン予測や学習された潜在変数への条件付けと組み合わせることで、よりエンドツーエンドでスケーリング可能な LLM へ進化させる可能性があります。
6.3 今後の研究方向性
- 逆探索的 XM: 検索を反転させ、1 回の生成が K のデータポイントを探るようにする(追加コストほぼなし)。
- 勾配ベースの探索: ランダム推測を損失直接降下による最適潜在変数の発見に置き換える。
- これらは理論的には K を全体のデータサイズまで増やし、生成モデリングを変化させる可能性があります。
7. 結論
このプロジェクトは、生成モデリングがなぜ難しいのかを深く理解し、「モード強制」という原理を発見することで始まりました。基本原理から出発し、表現力を高める手段として探索的モデリングに到達し、そこから新たな事前学習軸とエンドツーエンドな生成への道を開きました。
本質的な問い: 私たちは生成モデルの規模やそれを訓練するデータの量をスケーリングしてきたのに、なぜそれらが**「生成できること自体」をスケーリングしていないのでしょうか?**
- 参考文献: Alexi Gladstone, Heng Ji, Yilun Du. Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation.
- 論文リンク: arXiv:2607.27372
- ウェブサイト: explorative-modeling.github.io