探検的モデリング:K の推論の最良の結果を学習に使用する

2026/08/02 0:23

探検的モデリング:K の推論の最良の結果を学習に使用する

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

探索的モデリング(XM)は生成 AI に対して変革的なパラダイムを提示し、従来のデータスケーリングおよびパラメータ最適化とは区別される第 3 の事前学習の軸として確立されます。現在の単一トークン予測に制限された自己回帰モデルが、多様な回答を「平均的なぼやけ」に収斂させるという問題に対し、XM は訓練を K つの可能な対応候補ごとに分解し、各ステップで最良の一致からのグラディエントのみを使用します。このアプローチは、アーキテクチャの変更やハイパーパラメータの調整を要することなく、生成表現力を劇的に向上させます。結果は大きな効率性の向上を示しています:XM は既存の方法に比べてサンプル使用量を 6.2 倍、FLOP 効率を 4.1 倍、パラメータ効率を 47%改善します。具体的には、XM は制御タスクにおいて拡散モデルの能力と同等の性能を発揮しながら、推論計算リソースを最大 256 倍削減します(ポリシーは前方伝播 1 回のみで済む一方、Diffusion Policy では 100 回必要)。また、収束速度はほぼ 300 倍速くなります。効率性の向上に加え、XM は目標をノイズの多い記憶ではなく一貫性のあるものとして設定することで過学習を減少させ、探索を行わない場合の最良の FVD の 37.5 から 30.0 に改善します。標準的な単一トークン LLM への即座の決定的進歩は限定的かもしれないが、この技術は高解像度ビデオ生成(20%以上の向上)などの複雑なマルチモーダルタスクに対して堅牢な新たなレシピを提供し、業界におけるマルチトークン予測や潜在条件付けなどにおいて大きな有望性を示します。

本文

探索的モデリング:第 3 の事前学習軸とエンドツーエンドな生成の解放

1. 概要 (TLDR)

この研究では、既存の生成モデルに追加することで第 3 の事前学習軸となり、かつエンドツーエンドな生成を可能にする新たなパラダイムである「探索的モデリング(Explorative Modeling)」を導入します。主な特徴は以下の通りです。

  • 性能の向上: 画像、ビデオ、言語を含むすべての既存モデルで、探索の度合いを増やすことで一様に性能が向上し、その効果はスケーリングに伴いさらに増大します。
    • データ量による利点:7% から 36% に増加
    • パラメータ数による利点:13% から 23% に増加
  • 効率性の劇的改善: 探索的モデル(XMs)は以下の効率を大幅に向上させます。
    • サンプリング効率:6.2 倍の向上
    • FLOP 効率:4.1 倍の向上
    • パラメータ効率:47% の向上
  • エンドツーエンドな生成: XMs は制御タスクにおいてディフュージョンモデルと同等のパフォーマンスを発揮しつつ、推論時の計算資源を最大で 256 倍削減できます。

2. 問題の所在:なぜ直接予測は機能しないのか

2.1 直接的な回帰の失敗

  • 「犬を生成せよ」と命じられたとき、正しい答え(画像)は数十億枚存在します。
  • 神経ネットワークを直接犬の画像を予測するよう訓練すると、モデルは学習中の数千頭の異なる有効な犬を見てしまいます。
  • モデルが学ぶ結果は平均値になりますが、数千頭の犬の平均像は犬ではなく、単なる茶色のぼやけた影になってしまいます。
[実際の犬] -> データ
↓
[モデルの予測] -> 茶色のぼやけ (平均値)
*(図 1: 直接的な回帰ではデータと類似しない不良な答えが得られる)*

2.2 ダーツボードゲームによる説明

  • ゲームのルール: ダーツを投げ、次の着地点を推測する。推測とのズレほどスコアが悪い(損失最小化)。
  • 直感的な結論: エラーを最小化するにはボードの中央(平均値)を推測するのが最適に見える。
  • 現実: ダーツが実際に落ちる場所は中央にほとんどありません。「最適」な推測は、ダーツが決して落ちない場所です。
  • 結論: 予測に対して多数の有効な答えが存在する場合、単一の予測を平均化するのは誤りであり、あらゆるデータタイプ(画像、テキストなど)でこの問題が発生します。

2.3 既存モデルの解決策:生成因子化 (Factoring Generation)

  • ChatGPT や画像生成モデルはこの問題を生成プロセスを小さなステップに分割することで解決しています。
    • 自己回帰モデル: 一度に 1 つの要素のみを予測(例:「左右」を決めた後、「上下」を決定)。選択肢が狭まり、平均化が回避されます。
    • ディフュージョンモデル: 純粋なランダムノイズから数百の微小ステップを踏み、徐々に可能性を狭めます。
*(図 5: 自己回帰は配列要素を 1 つずつ予測し、選択肢を絞る)*
*(図 6: ディフュージョンはノイズからデータへ向かって微細ステップを踏む)*

2.4 課題:生成因子化の欠陥

このアプローチには重大な問題があります。

  1. 曝露バイアス (Exposure Bias):
    • 訓練時に数百〜数千のステップを実行するが、推論時には単一ステップのみで完結する。
    • 不完全な出力が入力としてフィードバックされ、誤差が累積して生成結果が逸脱する(例:ビデオモデルが途中で溶ける)。
  2. エンドツーエンドではない:
    • 訓練時と推論時の挙動が一致しないため、真のエンドツーエンドモデルとは言えません。
    • 深層学習の教訓(AlexNet)に従い、モデルをデータから直接全て学習させる方が優れています。生成モデリングだけがこの例外です。

3. 解決策:探索的モデリング (Explorative Modeling)

3.1 アイデア:学習ループの因子化

  • 「生成」と「訓練」にのみプロセスがあり、「生成は不可能なら、残るのは学習ループである」。
  • アイデア: 学習ループ自体を因子化する。
    • 1 つの推測ではなく、20 個の推測を与え、最も近いものだけをカウントするルールに変更する。

3.2 モード強制 (Mode Forcing) と探索的モデル (XMs)

  • メカニズム: 各訓練ステップにおいて、モデルは生成物と実際のデータの間の K 個の候補マッチを探求し、その中で最も良いものだけが訓練されます。
# 簡易コード例:モード強制
losses = []
for i in range(K):
    generation = model.generate()  # 別のランダムノイズから生成
    losses.append(loss_fn(generation, data))
min(losses).backward()            # 最も良い生成物だけが勾配を受ける
  • 効果: K を増加させることで、損失最小化点は「データの平均」から「データ自体(複数のモード)」へと移動します。これを**モード強制 (Mode Forcing)**と呼びます。
*(図 8: 探索の増加は平均をリアルなものに変換する)*
K=1 -> ぼやけ (平均)
K>1 -> リアルな画像 / "the the the" (複数モード)

3.3 生成表現力 (Generative Expressivity)

  • K はモデルがどの程度の異なる答えにコミットできるかを制御します。
    • K=1: 平均化(ぼやけた影)
    • K>1: 複数の有効な答えを捉える(20 つの異なる答え)
  • 重要: これまでの研究では、パラメータ数とデータ量がボトルネックとして注目されてきましたが、「生成表現力」はこの第 3 の軸でありながら見過ごされてきました。探索はこれをスケーリング可能なものに変えます。

4. 実証結果:効率性と一般化能力の向上

既存モデルに XMs を追加することで、以下の劇的な改善が見られました。

4.1 画像生成 (ImageNet) の性能向上

  • RAE レシピ:
    • 必要なデータ量:6.2 倍削減
    • FLOP: 4.1 倍削減
    • RAE と同等の最終性能達成(FID 1.43)
  • SiT ベースライン:
    • 計算資源:抑えた上で、必要データ量2.5 倍削減
    • FLOP 効率:最大 52% 向上
*(図 10: 少ないデータと FLOP で SOTA に到達)*
*(図 11: SiT ベースラインでの効率化)*

4.2 スケーリング効果

  • 探索による利得はスケーリングに伴い増大します。
    • データ量が増えるにつれ、利点は 7% → 36% に増加。
    • モデルが大きくなるにつれ、利点は 13% → 23% に増加。
  • これにより、固定された「生成表現力」がボトルネックとなっている大規模モデルの性能制限を緩和できます。
*(図 13: スケールとともに探索による利得が増加)*

4.3 一般化能力 (Generalization) の向上

  • 追加の訓練計算資源は直接、一般化能力を購入します。
    • より多くの探索を持つモデルは、固定データセットでの過学習を軽減。
    • FVD: 37.5 → 30.0 (無探索時の最良値 vs 探索あり)
*(図 14: 過学習の軽減と性能向上)*

5. エンドツーエンドな生成の実現

5.1 推論コストの劇的削減

  • 既存モデルは推論時に多数の生成ステップ(因子化)が必要でしたが、XM は訓練中に表現力を支払うため、推論時は単一フォワードパスで十分です。
タスクディフュージョンポリシー (既存)探索的ポリシー (XM)リストアップ (Lift)
フォワードパス数1001-
キャノンボール100%100%-
輸送 (Transport)94%96%+2.6%

5.2 ワールドモデルにおける成果

  • 目標条件付けされたワールドモデリングにおいて、XM は Diffuser よりも圧倒的に効率的です。
メトリックDiffuser (既存)探索的ワールドモデル (XM)改善率
スコア (平均)127.2130.0+2.2%
フォワードパス数 (平均)1922.3-98%

5.3 行動クローンタスクでの比較

  • XM は単一のフォワードパスで、100 パス必要なディフュージョンと同等の結果を達成
方法フォワードパス数リフト (Lift)キャノンボール輸送ツールハンギング
ディフュージョンポリシー100100%100%94%72%
探索的ポリシー (XM)1100%100%96%74%
*(図 9: 既存モデルは生成を因子化。対照的に XM は訓練を因子化し、推論時をシンプルにする)*

6. アドビションと将来展望

6.1 適用の容易さ

  • アーキテクチャ変更不要: 既存のモデル(画像・ビデオ・言語等)に擬似コード(for ループ)を追加するだけで可能。
  • 汎用性: 多様なデータセットやドメインで FLOP 効率、データ効率、一般化能力の向上を確認済み。
  • 判断基準: モデルの各予測が多くの有効な答えに直面しているほど(マルチモーダル性が高いほど)、探索からの恩恵は大きくなります。

6.2 LLM への適用可能性

  • 現状: 長いコンテキストから次のトークンを予測する場合、ほぼ 1 つの答えしかなく、即座的成功は限定的です。
  • 将来: データ効率への早期利得が確認されており、多トークン予測や学習された潜在変数への条件付けと組み合わせることで、よりエンドツーエンドでスケーリング可能な LLM へ進化させる可能性があります。

6.3 今後の研究方向性

  • 逆探索的 XM: 検索を反転させ、1 回の生成が K のデータポイントを探るようにする(追加コストほぼなし)。
  • 勾配ベースの探索: ランダム推測を損失直接降下による最適潜在変数の発見に置き換える。
    • これらは理論的には K を全体のデータサイズまで増やし、生成モデリングを変化させる可能性があります。

7. 結論

このプロジェクトは、生成モデリングがなぜ難しいのかを深く理解し、「モード強制」という原理を発見することで始まりました。基本原理から出発し、表現力を高める手段として探索的モデリングに到達し、そこから新たな事前学習軸とエンドツーエンドな生成への道を開きました。

本質的な問い: 私たちは生成モデルの規模やそれを訓練するデータの量をスケーリングしてきたのに、なぜそれらが**「生成できること自体」をスケーリングしていないのでしょうか?**

同じ日のほかのニュース

一覧に戻る →

2026/08/02 7:25

正しい質問さえすれば、AI ファイナンシャルアドバイスの精度は驚くほど高い

## Japanese Translation: 人工知能(AI)は、人間のアドバイザーに見られるコスト、偏見、利益相反を回避して利用者を支援する安価な財務指導を提供しますが、監督なしでその自動的なアドバイスに従うと、壊滅的な資産損失を引き起こす可能性があります。MIT スローン校およびスタンフォード大学の学者による最近の研究では、現在の AI モデルには失業のような急激な経済ショックに適応するためのニュアンスが欠けており、たとえ蓄積があるにもかかわらず、大規模な支出削減を誤って推奨する傾向にあることが明らかにされています。さらに、これらのモデルはアクティブなポートフォリオ再調整で困難に遭遇し、状況の変化に合わせて調整する代わりに漂う(ドリフトする)傾向があります。この制限はデータへのアクセス不足ではなく、プロンプトエンジニアリングの不備およびモデル自体の偏見に起因します。 22 歳から 89 歳までの個人を追跡する大規模なシミュレーションでは、構造化されていない AI との相互作用への依存により、60 歳までに格差が大幅に拡大しました。具体的には、女性や財務リテラシーが低い利用者は、プロンプトの作成方法においてもモデルによる解釈方法においても存在する性別偏見により、純資産が最大で 10 万ドル減少するという結果を示しました。専門家は、取引に基づく AI 指示のみを頼りにし、事前にリテラシー教育を受けていない場合に、最も脆弱なグループに対しては、予測される資産の約 6% に相当する複合的な損失が発生する可能性があるとして警告しています。したがって、本研究では AI を主に財務理解を構築するための手段として利用すること、および企業側が製品説明がますます独立した推奨事項を生み出し、従来のマーケティングの防護策を回避する可能性に留意しなくてはいけないことを提言しています。

2026/08/02 5:33

ダイタキシス

## Japanese Translation: Diátaxis は、ユーザーニーズ、コンテンツ、スタイルおよびアーキテクチャに対応しながら、堅固な実装制約を課さずに高品質な技術文書の作成を行うための体系的で軽量なフレームワークです。その核心的な強みは、チュートリアル、ハウツーガイド、技術リファレンス、説明という 4 つの異なる情報タイプを分類し、読者の意図と整合させるためにこの構造を中心にコンテンツを整理することにあります。この能動的品質原則は、情報アーキテクチャを簡素化し発見可能性を高めるシンプルなアプローチを提供することで、作成者とユーザーの双方に力を付与します。Diátaxis は数百プロジェクトで成功裏に採用されており、Cloudflare などの組織のリデザインにおいて「北極星」として機能しています。具体的な事例では、Vonage においては Greg Frileux が貢献者から愛されている内部ドキュメントの構築に役立ったことを指摘し、Gatsby においては Megan Sullivan がオープンソースリソースを再編成して発見しやすくしたことが挙げられます。結局のところ、Diátaxis はドキュメントが読者に直接的な価値を提供するとともに、明確で構造化されたコンテンツを通じて企業が貢献者を保持するのを支援します。

2026/08/02 5:45

シードダンス 2.5

## Japanese Translation: ByteDance が、長編ストーリーテリング、精密な編集、そして高度なマルチモーダル参照における画期的な進歩によりコンテンツ制作を革新することを目的とした次世代の動画生成モデル「Seedance 2.5」を正式にローンチしました。本モデルは、1 つのパスで高品質な 30 秒間のオーディオ・ビデオクリップを生成し、複数ラウンドの拡張をサポートして一貫性のある数分の長編ナラティブを作成できます。ユーザーはガイドとして最大 30 枚の画像、10 クリップ分の動画、または 10 クリップ分のオーディオを入力でき、テクスチャレスな 3D モデルを使用して複雑な空間構造を構築する際に役立つ粘土レンダリング参照も使用可能です。Seedance 2.5 はオーディオとビデオの精密な編集のためにタイムスタンプレベルの制御を導入し、グリーンスクリーンやカメラ視点変更などの機能を増強しつつ、カット間での対象物の安定性とビジュアル同期を保証します。システム最適化により、物体のテクスチャ、肌/目の特徴、物理法則に従う照明などといった視覚的な詳細が向上し、AI 動画に一般的な人工的な外見を大幅に軽減します。本技術は、歴史および科学的文脈向けの没入型教育シミュレーション、ロボットトレーニング用の合成データ生成、自動運転車両向けの極端な気象シナリオの安全なシミュレーションなど多様な用途への展開を可能にします。本日、Jimeng AI と Doubao Pro でお利用可能で、より広範な API アクセスは間もなく BytePlus ModelArk を介して提供されます。本モデルは、将来的な運動の妥当性と複雑なシーンにおける安定性の向上のための基盤を築きます。

探検的モデリング:K の推論の最良の結果を学習に使用する | そっか~ニュース