
2026/08/03 22:34
ComfyUI で MiniMax H3 の Day-0 サポート導入:オープンウェイト、ネイティブ音声対応、2K 動画生成
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
MiniMax H3 は MiniMax の第 3 世代動画モデルであり、Hailuo 01 および Hailuo 02 に次ぐシリーズのもので、同シリーズで最初におープンウェイト付きとしてリリースされたモデルです。ComfyUI v0.30.0(または Comfy Cloud を通じて)で完全に対応されています。本モデルはテキストから動画、画像から動画、第 1/最終フレーム制御、参照から動画、およびネイティブ音声生成という 5 つの異なる創作タスクを単一のシステムに統合しています。モデルは本来、2K リゾリューション、15 秒のクリップ、リアルなステレオサウンドを生成し、以前には別々のポストプロダッシングステップ(特に音声処理)が存在していたものを 1 パスに集約します。高度な機能には、参考動画を用いて動きを取り入れながら主題とスタイルは個別に定義するモーショントランスファーや、入力に対してプロンプトで記述したそれらとの関係性を解釈して出力を生成するクロスモーダル解決があります。機械学習工学の高度化により、ルッキングアップテーブルへ置換(パラメータの約 40%)および剪断调制重み(~40% のパラメータ)を用いることでモデルのメモリフットプリントを66%削減し、さらに効率的なint8 convrot quantizationとカスタムカーネルを組み合わせています。これにより、VRAM 使用量は完全精度時の 123.6 GB からわずか42.5 GBに削減され、RTX 3060 などの消費者向け GPU でも高忠実度のローカル生成が実現します。モデルウェイトは🤗 Comfy-Org/MiniMax-H3で利用可能であり、I2V、R2V、T2V タスク用のダウンロード可能なワークフローも提供されており、独立系クリエイターや小規模スタジオへの導入障壁を低下させています。
*(注:この改善されたサマリーはキーポイントリストに欠けていた全ての要素を取り入れつつ、明瞭さを保ち、根拠のない推論を避けるよう調整されています。)
本文
MiniMax H3: 次世代オープンウェイト動画生成モデルの公開と ComfyUI 対応
MiniMax H3 が今日、オープンウェイトとして正式に公開されました。今早朝より ComfyUI へのネイティブ対応も開始し、「Day Zero(第一日)」を迎えています。これはテキスト、画像、動画、音声を投入するだけで、リアルなステレオサウンドを備えた最高解像度 2K の動画を最大 15 セカンドまで生成できる次世代モデルです。
H3 は Hailuo 01、Hailuo 02 に続く MiniMax の第 3 世代動画モデルであり、同社が初めて公開するオープンウェイトモデルでもあります。
主要機能
- テキストから動画 (T2V) – プロンプトのみで動画を生成します。
- 画像から動画 (I2V) – 静的な画像に動きと命を吹き込みます。
- 始端・終端フレーム制御 – 開始フレーム、終了フレーム、または両方を指定し、モデルがその間の部分を自動補完します。
- リファレンスから動画 (R2V) – リファレンス画像、動画、あるいは音声を投入し、キャラクターの動きや演出リズム、声などを変化させずに維持しながら生成を行います。
出力品質とクロスモーダル処理
- 解像度と長さ: 最高 2K 解像度で、最大 15 セカンドの長さを対応します。
- ネイティブステレオサウンド: 音声は後処理や合成ではなく、動画生成と並行して同時に処理され、モデル自身が生成する固有の属性として出力されます(すべてネイティブステレオ)。
- 統合的なタスク解決: これまで 5 つに分割されていたタスクが一つに統合されました。画像、音声、動画を同時に受け取り、入力素材間の関係性を記述し、望むショット仕様を示すだけで、クロスモーダルの処理を自律的に行います。
モーション転送と編集
- グラフ系ワークフローでの活用: リファレンス動画からカメラ移動や演技、カットのリズムなどの動きを抽出します。
- スタイルの切り替え: 対象やスタイルは別のソースから提供することで、抽出した動きとの組み合わせによりショットの反復制作が可能になります。
- In-place エディティング: モーション転送機能に In-place エディティングを組み合わせることで、効率的なイテレーション(試作)が実現します。
パフォーマンス最適化
H3 を一般向けハードウェアで順調に動作させるために、多大な機械学習エンジニアリングが施されました。
- モデル剪定: モデルの調整重み(全パラメータのごく一部である約 40%)を剪定し、機能的に同等なテーブル(ルックアップテーブル)で置き換えることで、出力品質を損なわずメモリの使用量を劇的に削減しました。
- kv8 ConvRot クアンタ化: 重みには正確かつ効率的な
クアンタ化が適用され、専用カーネルにより推論時のピーク VRAM 使用量が抑えられています。int8 - メモリフットプリントの削減: フル精度での 123.6 GB というメモリ要件から、最小モデルバリアントではわずか 42.5 GB にまで削減されました(約 66% の減少)。
- GPU 互換性: これらの技術を当社の動的な VRAM オフロード機能と組み合わせることで、次世代の 2K ビデオ生成モデルを RTX 3060 クラスの GPUでもローカル環境で動作させることを実現しました。
インストールと使用方法
-
環境準備
- ComfyUI を最新版(0.30.0 以上)にアップデートするか、Comfy Cloud にアクセスしてください。
-
ワークフローの導入
- 以下のいずれかのワークフローをダウンロードし、またはテンプレートライブラリから検索・使用してください:
MiniMax H3 I2V ワークフロー MiniMax H3 R2V ワークフロー MiniMax H3 T2V ワークフロー
- 以下のいずれかのワークフローをダウンロードし、またはテンプレートライブラリから検索・使用してください:
-
モデルファイルの準備
- ワークフロー内の手順に従って、以下のモデルファイルをダウンロードし、適切なモデルディレクトリに保存してください。
モデルウェイト: 🤗 Comfy-Org/MiniMax-H3
-
実行
- プロンプトを入力し、必要に応じてフレーム入力またはリファレンス入力を接続して実行してください。
いつものように、創作を楽しんでください!本投稿に関する議論も歓迎しています。さらに新しい機能に期待しましょうか?