
2026/08/31 5:46
継続的拡散言語モデル(CDLM)
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
言語モデルの Landscape は、2025 年から 2026 年にかけて連続拡散言語モデル(CDLM)が大きく再注目されることにより、2023 年末以降に見られた一時的な衰退を逆転する形で大きな変革を迎えています。この復活は、ステップ蒸留や高度なフローマップといった技術的ブレークスルーによって促進されており、これらは極めて効率的なワンステップサンプリングを可能にし、マルチステップ離散モデルが達成困難とみなされていたトークン間の相関を捉えることを実証しています。Google DeepMind(DiffusionGemma)や NVIDIA(Nemotron Diffusion)を含む主要テクノロジー企業は、現在これらのアプローチを検証しており、自己回帰が唯一の viable なパスではないことを示しています。2025 年には、時間的不整合などのスケーリング問題を解決するため、離散マスクングと連続腐食を組み合わせる CADD、CCDD、CANDI などを含むハイブリッドなフェーズが登場しました。2026 年初頭には、主要論文がフローマップを離散的カテゴリカルデータに拡張し(例:カテゴリカルフローマップ)、その結果として 2026 年春に LangFlow、Spherical flows、Hyperspherical flows、LDLM、ELF、CoBit、RePlaid を特徴とする CDLM 研究の「カンブリア爆発」が発生しました。これらの進展は、連続拡散が大規模な尺度で離散的手法と競合できることを示しています。品質と多様性のトレードオフを改善するためハイブリッド戦略が注目されていますが、業界のさらなる成長を継続させるためには、生成性パープレキシティ指標を含む評価手法の標準化も依然として重要です。研究者たちはまた、単一トークンから全文段落までのさまざまな粒度で潜在拡散を探求しています。 upcoming のサンフランシスコおよびシドニーで開催されるワークショップは非自己回帰モデルに焦点を当てています。離散拡散が viable なままではあるものの、これらの改良された実装により、コミュニティが離散アプローチが連続アプローチに優位だと信じていたという合意は弱まっています。
本文
連続拡散言語モデル(CDLM)の復活:歴史、技術、そして未来への展望
長年の停滞期を経て、**連続拡散モデル(Continuous Diffusion Models)**の分野で再び活発な研究が行われるようになっています。当初は離散的な拡散手法が優勢でしたが、現在は状況が逆転しつつあります。本稿では、その背景、技術的詳細、および最新の動向について考察します。
1. 回帰的支配への挑戦と歴史的背景
言語モデルの主流:回帰的アプローチ
現代の言語モデルはほぼ例外なく**「回帰的(autoregressive)」**です。
- トークンを一つずつ順序立てて生成します。
- シーケンスを小さなステップに分解し、パラメータ共有を可能にするため、Transformer 構造や教師強制(teacher forcing)と相性が良いです。
拡散モデルへの応用
画像・音声分野で成功した拡散手法は、情報を徐々に破壊する腐敗プロセスの逆転によってシーケンス全体を生成します。
- 初期の試み(2021 年):連続的な腐敗を離散的なものに置き換え、カテゴリカルデータをモデル化(例:マルチノミアル拡散)しました。
- 背景:当時、「ChatGPT の瞬間」に至る前であり、回帰的アプローチの理論的欠陥(曝露バイアスなど)を補うために期待されていました。
連続拡散への転換点
- 2022 年:Diffusion-LMが登場。カテゴリカルデータとガウシアンノイズの不整合を、埋め込みベクトルを用いた連続的な腐敗プロセスで解決しました。これにより、画像生成で培われたサンプリングや蒸留技術がそのまま適用可能になりました。
2023 年後半:絶滅と再考
- 一時的に研究は離散拡散(DDLM)へ集中し、連続拡散は事実上「絶滅」しました。
- 理由:
- 「ChatGPT の瞬間」後の生性能重視の潮流。
- 学習効率(Plaid など)が回帰モデルより 64 倍も低く見られたこと。
- LLM コミュニティがトレーニング計算量と困惑度(perplexity)の Pareto frontier に集中していたため、非効率的なアプローチは採り扱いされませんでした。
著者の視点: その時点では研究を停止し傍観者となりました。連続拡散に秘められた「不確実性の表現」や「サンプリングツールの豊富さ」といった利点が捨てられたのは残念だと感じていました。
2. 離散データへの連続拡散の適応(CDLM の技術)
最近の動向を理解するには、まず連続拡散を離散データに適用する方法を整理する必要があります。
基本構成要素
- 埋め込み戦略: 離散入力を実数空間へ「引き起こす(lift)」処理。
- 損失関数: アンエンベッディング戦略と連動。
- ノイズスケジュール: 腐敗プロセスの均一化に重要。
- 自己条件化: デノイザーへの冗長性を解消し、パフォーマンス向上。
具体的な技術課題
① 埋め込み戦略(Embedding Strategies)
連続拡散における埋め込み空間の役割は DDLM に比べて大きいです。
- 明示的(Explicit, e.g., SSD-LM): One-hot ベクトルを使用。辞書サイズ $V$ が巨大なため扱いにくい場合があります。
- 事前学習済み(Pre-trained, e.g., SED): BERT 等の双方向言語モデルや回帰モデルから借用し、文脈化された埋め込みを使用します。
- 共同学習(Joint, e.g., CDCD): 埋め込みとデノイザーをエンドツーエンドで最適化。最も自然なアプローチとされています。
課題: ナイーブな定式化では埋め込みが崩壊する可能性があります。損失関数によるトレードオフや、正規化(単位ノルム強制)が必要です。また、「猫」のノイズレベルは「犬」と似て「傘」とは異ならないなど、幾何学的構造の重要性も議論されています。
② 損失関数(Loss Functions)
- MSE: デノイザーが連続空間で直接予測する場合。視覚・音声モデル同様です。
- カテゴリカルクロスエントロピー: デノイザーが辞書要素間の確率を出力する場合(回帰的設定に似る)。トークンごとの埋め込みのみ対応可能です。
- 変分自動エンコーダー風: 下からの境界付き尤度目標。正規化項の追加やパラメータ化による制約が可能です。
③ ノイズスケジュール(Noise Schedules)
CDLM では、高次元埋め込み空間における不均一な腐敗を避けることが特に重要です。
- 問題: ナイーブなスケジュールでは、低すぎれば情報を失わないし、高すぎれば全ての情報が壊れてしまいます。
- 解決策: オフライン/オンライン適応。
- エンタルピーの線形化(各ステップで同じビット数を解決)や、デコードエラー率の線形化を学習します(例:$t$ を均一にサンプリングする場合)。
- VDM や PLaid などの手法からインスピレーションを得ています。
④ 自己条件化(Self-Conditioning)
拡散サンプリングは「状態を持たない(stateless)」ため、以前のステップの予測が使えません。これを解決するために、前の予測を次の入力として渡す機構が導入されました。
- 効果: デノイザーはゼロから予測する必要がなくなり、荒い推定値の修正に特化できます。
- 言語拡散への適用: 視覚分野では必須ではありませんでしたが、言語モデル(特に離散的構造を持つ)ではパフォーマンスを劇的に向上させました。現在はほぼ全ての研究で使用されています。
ホームメイドレシピの例
著者の過去の研究による具体例:
- Simplex Diffusion: コックス・インガースオール・ロッセ(CIR)過程を使用。確率分布モデル化に適する。
- SED (Self-Conditioned Embedding Diffusion): BERT の事前学習済み埋め込みを使用。クロスエントロピー損失とコサインスケジュールを組み合わせる。
- CDCD: 標準的なガウシアン拡散とスコア間補(Score Matching)によるクロスエントロピー損失を採用。正規化レイヤと自己条件化を組み込む。
3. 最近の復活:2025 年〜2026 年
2025 年:ハイブリッドアプローチの登場
人々は離散・連続両方の利点を活かすために、以下の手法を考案しました。
- CADD, CCDD, CANDI:
- 連続中間表現を用いてマスキング拡散を増補(CADD)。
- 同時共同拡散で表現力を高める(CCDD)。
- 「時間的不調和(temporal dissonance)」という課題に対し、離散的マスキングとガウシアン腐敗を分離する手法(CANDI)です。
- 目的: 連続拡散モデルへのコンシステンシー蒸留やトレーニング損失の分散削減を実現。
2026 年:純粋な連続拡散の逆襲
フローマップ(Flow Maps)の開発と採用が加速し、完全な連続手法が復活しました。
- Categorical Flow Maps: One-hot 埋め込みとクロスエントロピー損失で離散カテゴリカル設定へ拡張。
カンブリア爆発のような動き
いくつかの主要なアプローチが登場しました:
- LangFlow, Spherical/Hyperspherical flows: CDCD を基盤に、適応的ノイズスケジュールや正規化埋め込みを使用。
- LDLM (Latent Diffusion Language Models), ELF (Embedded Language Flows): 文脈埋め込み(コンテキスト)を採用。ELF は事前学習済み埋め込みを凍結します。
- CoBit: アナログ・ビットズ(Analog Bits)アプローチを言語に適用。
- RePlaid: Plaid を近代化し、離散拡散と競合する性能を実現。
主張: RePlaid や LangFlow は、「連続拡散は離散拡散と同等かそれを凌駕できる」と主張しています。
4. なぜ「連続」なのか?そしてなぜ「今」なのか
シンプルさの向上
- 早期にはスコアマッチングや微分方程式の知識が必要でしたが、現在はデータとノイズの線形補間という直感的な概念で理解できます。参入障壁が下がりました。
モデリングパラダイムへの関心の高まり
- LLM が巨大化した背景で、言語モデルを速く・柔軟にすることが高経済価値になりました。
- 回帰を超えた代替パターンの探求が進んでいます。
ステップ蒸留と少ステップサンプリングの優位性
- 問題: 回帰モデルへのステップ蒸留には、トークン間の独立性という仮定があり限界があります(単一ステップで全相関を捉えるのは困難)。
- 解決: 連続手法(特にフローマップ)は理論上単一ステップでも全相関を捉えます。これが CDLM が復権する最大の理由です。
ポストトレーニングの可能性
- ステップ蒸留により高速化だけでなく、報酬ベースのステアリングやファインチューニングも可能になります。これは現代 LLM の成否を決める重要な要素です。
多モーダル統合について
- 「すべてのモダリティで連続拡散を使用すれば統合が容易になる」という主張がありますが、本質的な課題はセマンティックギャップ(抽象的言語トークン vs 具体的な知覚信号)にあり、単純な手法の適用では解決しにくい可能性があります。
5. 離散モデルは淘汰されるのか?
結論として、離散拡散(DDLM)が完全に消えるわけではありません。両者は共存するでしょう。
- Dimitri von Rütte や Volodymyr Kuleshov: 離散拡散の将来性を強調。
- オープンウェイトモデルの登場: Google DeepMind の
や NVIDIA のDiffusionGemma
などが、回帰以外の選択肢であることを示しました。Nemotron Diffusion
ハイブリッドと蒸留の可能性
- D-MMD, IDLM: 連続設定から離散設定への蒸留が可能であることが示されています。
- Speculative Decoding(推測的デコード): より速いドラフトモデルとして離散拡散を利用します。
- DMax: 独立仮定の影響を減らすために連続緩和とポストトレーニングを組み合わせる手法。
- Sticky Jump Diffusions: SDE フォーマリズムに基づく統一視点。
- Posterior Refinement: マスキッド拡散内に連続拡散をラップし、ネストされたサンプリングループを作成。
6. 次は何か:課題と展望
評価手法の標準化が急務
現在、モデルの評価は「柔軟なサンプリング手順」のため、品質と多様性のトレードオフに依存しています。
- 問題: 標準化された指標がないため、異なる論文間で比較が困難です。「GenPPL(Generative Perplexity)」などの代理指標には限界があります。
- 提言: パトリック・ピナダスなどが提案する「ジェネレーティブフロンティア(困惑度対エントロピープロット)」による定量化が必要です。
より高レベルの表現学習
- 現在、トークンやフレーズ単位だけでなく、文や段落レベルでの表現学习が進んでいます(例:
,Time Control
,PLANNER
など)。AURORA-LM - これらの方向性は「言語のための潜在拡散」として研究されていますが、最大の課題は潜空間そのものの学習です。画像処理で成功した表現学習技術が、抽象的な言語表現にはそのまま適用できない可能性があります。
まとめ
- CDLM は再び主流に戻っています。主な理由はステップ蒸留による効率性と、ポストトレーニングの可能性にあります。
- 特定のレシピへの収束はまだなく、研究として非常に魅力的な空間です。
- 以前は「離散拡断の方がスケール性能が良い」というコンセンサスが薄れつつあり、努力の方向性が結果に大きく影響します。
今後のイベント:
- COLM 2026 (San Francisco): Non-Autoregressive Language Models for Fast & Flexible Text Generation
- NeurIPS 2026 (Sydney): Diffusion Language Models: Foundations, Efficiency, and Reasoning
謝辞と開示
- 著者はこの記事を手動で執筆しており、AI を一部の用語確認や図作成にのみ使用しました。
- 引用の際は以下の BibTeX をご参照ください。
@misc{dieleman2026continuousdlms, author = {Dieleman, Sander}, title = {Continuous diffusion language models}, url = {https://sander.ai/2026/08/24/continuous-dlms.html}, year = {2026} }