
2026/08/20 22:24
DiffusionGemma 技術報告書
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
サマリー:
DiffusionGemma は AI の速度において画期的な成果を示しており、単一の NVIDIA H100 GPU 上で約 1,500 トokens/秒のテキスト生成が可能である。この例外的な速度は、従来の自回帰モデルが単語を一つずつ連続的に処理するのに対し、ブロック(具体的には 256 トokens)を同時に行う離散的拡散(discrete diffusion)という技術によって達成される。Mix-of-Experts の Gemma 4 ベースモデル(38 億アクティブパラメータ、252 億総パラメータ)を微調整することで開発された本アプローチは、標準的な手法に必要なトレーニングリソースの 10% を満たさない計算効率的な二段階パイプラインを採用しており、まず双方向のノイズ除去のための監督微調整を行い、次に品質と効率を向上させるためにサンプリャー蒸留を伴う強化学習を行う。以前の試みでは即使意的なデコード技術を用いてもレイテンシーに制限されていたが、DiffusionGemma はこれらの連続的ボトルネックを効果的に回避し、全評価スイートを通じてフォワードパスあたり約 20 トokens を達成する。高度な拡散ベースのトレーニングにもかかわらず、このモデルは長いコンテキストの対応、マルチモーダル入力のサポート、思考モード、自回帰生成といった重要な機能を失うことなく維持しており、性能低下も最小限である。この安定性は、拡散の効率性と自回帰の精度を組み合わせるハイブリッド戦略の実用性を示唆している。最終的には、この技術はチャットボットやコーディングアシスタントなどのリアルタイムアプリケーションにおいて生成遅延を劇的に削減することで、かつてないほど瞬時の対話を実現し、それらの分野を革新する見込みがある。
本文
DiffusionGemma: 離散拡散プロセスによる高速テキスト生成モデル
概要
本研究では、極めて高速なテキスト生成を可能にする実験的な開示重み言語モデル「DiffusionGemma」を紹介する。従来の自己回帰型(AR)モデルが順次において 1 トークンずつデコードするのではなく、本モデルは以下の革新を持っています。
- ブロック単位の並列処理: ブロック単位で最大 256 トークン を並列に反復的に洗練させる。
- 逐次デコードの回避: AR モデルに見られる逐次デコードのボトルネックを解消する。
- 基礎モデル: 38 億パラメータがアクティブ化され、総パラメータ数は 252 億 の Gemma-4(ミックス・オブ・エキスパート構成)をファインチューニングして作成。
- ゼロからではない: 既存の強力なアーキテクチャを活かしつつ、生成速度と能力の両立を目指した開発アプローチを採用。
訓練パイプライン
計算資源効率の高い 2 段階訓練パイプライン を採用しており、初期 AR モデルの使用したトークン予算よりも 10% 以下 で済ませる設計である。
- 第 1 ステージ:教師ありファインチューニング
- 双方向的なノイズ除去を学習させる。
- 第 2 ステージ:強化学習と蒸留の組み合わせ
- 強化学習 を用いて生成品質を向上。
- サンプリャー蒸留 を用いて推論効率を向上。
- 両者を組み合わせて生成品質と推論効率を同時最適化。
パフォーマンス評価
DiffusionGemma は、生成速度とモデル能力のトレードオフにおいて新たなパレト frontier を確立した。全体的な評価スイートにおける平均値は以下の通りである。
- 生成速度: 1 つのフォワードパスあたり約 20 トークン。
- 出力速度: 単一の NVIDIA H100 GPU 上で約 1,500 トークン/秒。
- これは最先端の推測的デコード技術を採用した AR モデルよりも 大幅に高速。
モデル機能と拡張性
拡散ファインチューニングにもかかわらず、初期 Gemma-4 の重要な特徴を維持している。
- 「Thinking mode」 のサポート。
- マルチモーダル入力 の対応。
- 長文脈の処理 能力。
- AR による生成への互換性: AR デコードでも性能劣化が僅かであり、ハイブリッドな拡散ーAR デコードへの道筋を示唆する。