ComfyUI で MiniMax H3 の Day-0 サポート導入:オープンウェイト、ネイティブ音声対応、2K 動画生成

2026/08/03 22:34

ComfyUI で MiniMax H3 の Day-0 サポート導入:オープンウェイト、ネイティブ音声対応、2K 動画生成

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

MiniMax H3 は MiniMax の第 3 世代動画モデルであり、Hailuo 01 および Hailuo 02 に次ぐシリーズのもので、同シリーズで最初におープンウェイト付きとしてリリースされたモデルです。ComfyUI v0.30.0(または Comfy Cloud を通じて)で完全に対応されています。本モデルはテキストから動画、画像から動画、第 1/最終フレーム制御、参照から動画、およびネイティブ音声生成という 5 つの異なる創作タスクを単一のシステムに統合しています。モデルは本来、2K リゾリューション、15 秒のクリップ、リアルなステレオサウンドを生成し、以前には別々のポストプロダッシングステップ(特に音声処理)が存在していたものを 1 パスに集約します。高度な機能には、参考動画を用いて動きを取り入れながら主題とスタイルは個別に定義するモーショントランスファーや、入力に対してプロンプトで記述したそれらとの関係性を解釈して出力を生成するクロスモーダル解決があります。機械学習工学の高度化により、ルッキングアップテーブルへ置換(パラメータの約 40%)および剪断调制重み(~40% のパラメータ)を用いることでモデルのメモリフットプリントを66%削減し、さらに効率的なint8 convrot quantizationとカスタムカーネルを組み合わせています。これにより、VRAM 使用量は完全精度時の 123.6 GB からわずか42.5 GBに削減され、RTX 3060 などの消費者向け GPU でも高忠実度のローカル生成が実現します。モデルウェイトは🤗 Comfy-Org/MiniMax-H3で利用可能であり、I2V、R2V、T2V タスク用のダウンロード可能なワークフローも提供されており、独立系クリエイターや小規模スタジオへの導入障壁を低下させています。

*(注:この改善されたサマリーはキーポイントリストに欠けていた全ての要素を取り入れつつ、明瞭さを保ち、根拠のない推論を避けるよう調整されています。)

本文

MiniMax H3: 次世代オープンウェイト動画生成モデルの公開と ComfyUI 対応

MiniMax H3 が今日、オープンウェイトとして正式に公開されました。今早朝より ComfyUI へのネイティブ対応も開始し、「Day Zero(第一日)」を迎えています。これはテキスト、画像、動画、音声を投入するだけで、リアルなステレオサウンドを備えた最高解像度 2K の動画を最大 15 セカンドまで生成できる次世代モデルです。

H3 は Hailuo 01、Hailuo 02 に続く MiniMax の第 3 世代動画モデルであり、同社が初めて公開するオープンウェイトモデルでもあります。

主要機能

  • テキストから動画 (T2V) – プロンプトのみで動画を生成します。
  • 画像から動画 (I2V) – 静的な画像に動きと命を吹き込みます。
  • 始端・終端フレーム制御 – 開始フレーム、終了フレーム、または両方を指定し、モデルがその間の部分を自動補完します。
  • リファレンスから動画 (R2V) – リファレンス画像、動画、あるいは音声を投入し、キャラクターの動きや演出リズム、声などを変化させずに維持しながら生成を行います。

出力品質とクロスモーダル処理

  • 解像度と長さ: 最高 2K 解像度で、最大 15 セカンドの長さを対応します。
  • ネイティブステレオサウンド: 音声は後処理や合成ではなく、動画生成と並行して同時に処理され、モデル自身が生成する固有の属性として出力されます(すべてネイティブステレオ)。
  • 統合的なタスク解決: これまで 5 つに分割されていたタスクが一つに統合されました。画像、音声、動画を同時に受け取り、入力素材間の関係性を記述し、望むショット仕様を示すだけで、クロスモーダルの処理を自律的に行います。

モーション転送と編集

  • グラフ系ワークフローでの活用: リファレンス動画からカメラ移動や演技、カットのリズムなどの動きを抽出します。
  • スタイルの切り替え: 対象やスタイルは別のソースから提供することで、抽出した動きとの組み合わせによりショットの反復制作が可能になります。
  • In-place エディティング: モーション転送機能に In-place エディティングを組み合わせることで、効率的なイテレーション(試作)が実現します。

パフォーマンス最適化

H3 を一般向けハードウェアで順調に動作させるために、多大な機械学習エンジニアリングが施されました。

  • モデル剪定: モデルの調整重み(全パラメータのごく一部である約 40%)を剪定し、機能的に同等なテーブル(ルックアップテーブル)で置き換えることで、出力品質を損なわずメモリの使用量を劇的に削減しました。
  • kv8 ConvRot クアンタ化: 重みには正確かつ効率的な
    int8
    クアンタ化が適用され、専用カーネルにより推論時のピーク VRAM 使用量が抑えられています。
  • メモリフットプリントの削減: フル精度での 123.6 GB というメモリ要件から、最小モデルバリアントではわずか 42.5 GB にまで削減されました(約 66% の減少)。
  • GPU 互換性: これらの技術を当社の動的な VRAM オフロード機能と組み合わせることで、次世代の 2K ビデオ生成モデルを RTX 3060 クラスの GPUでもローカル環境で動作させることを実現しました。

インストールと使用方法

  1. 環境準備

    • ComfyUI を最新版(0.30.0 以上)にアップデートするか、Comfy Cloud にアクセスしてください。
  2. ワークフローの導入

    • 以下のいずれかのワークフローをダウンロードし、またはテンプレートライブラリから検索・使用してください:
      MiniMax H3 I2V ワークフロー
      MiniMax H3 R2V ワークフロー
      MiniMax H3 T2V ワークフロー
      
  3. モデルファイルの準備

    • ワークフロー内の手順に従って、以下のモデルファイルをダウンロードし、適切なモデルディレクトリに保存してください。

    モデルウェイト: 🤗 Comfy-Org/MiniMax-H3

  4. 実行

    • プロンプトを入力し、必要に応じてフレーム入力またはリファレンス入力を接続して実行してください。

いつものように、創作を楽しんでください!本投稿に関する議論も歓迎しています。さらに新しい機能に期待しましょうか?

同じ日のほかのニュース

一覧に戻る →

2026/08/04 6:13

LLM は専門性を報酬とする

## 日本語翻訳: 大規模言語モデル(LLM)は、CSS など基本的なデジタルタスクへの参入障壁を下げていますが、深いドメイン知識の必要性を排除するものではありません。一般的に応用提示技術(generalist prompting techniques)を習得すれば真の価値を引き出せるという一般的な誤解がありますが、複雑な問題解決には特定の分野の知識が不可欠であり、それによって AI を効果的に導く必要があります。数学者のテレンス・ tao の LLM に関する研究に示されるように、専門的な成果は簡潔であるといったスタイル上のヒントではなく、真の理解から生じます。分野に対する親和性がない場合、ユーザーは出力を検証したり、モデルを高度な解決策へと導いたりすることができず、質問の工夫がいくら手巧くてもその限りではありません。著者は、トークンが無限にあっても、非専門家は Tao 氏のような複雑な数学問題においては彼のレベルには達できないと指摘しており、分野知識こそが決定的な要因であることを強調しています。したがって、モデルがさらに強くなるにつれて、人間が正確な要件を伝達し結果を検証するという役割がボトルネックとなります。そのためには、組織は平均的な成果を超えようとする場合、特別な訓練への投資や専門家を採用することが必要であり、AI 統合の未来は汎用的なインターネット検索スキルよりも、制約を定義し高品質な結果を確保するために特定分野での卓越した知識を育成することによって支えられるでしょう。

2026/08/03 23:15

デベロッパーツールのオープンソース化が必須です。

## 日本語翻訳: 人工知能(AI)エージェントは、大規模なユーザーコミュニティや複雑な設定ファイルに依存せずに個々の作成者がパーソナライズされたアプリケーションを構築することを可能にするため、ソフトウェア開発を変革しています。VS Code の拡張機能や vimdiff といった従来の API はリアルタイムでのファイル変更やバックグラウンド処理で苦戦するのに対し、Shelley とような AI エージェントは、上流リリースとの nightly スインジングや人間のレビュー前のコードのプリプロセスなどの複雑なタスクを自動的に処理します。これは、過去 5 年の間にエンジニアが高い維持コストと疑わしい投資対効果のためにカスタムツールを廃棄することが多かった時代から、現在、かつて高価なプラグインシステムを必要としたか多くのユーザーにアモルタイズされた機能が単一ユーザーのために瞬時に組み立てられることへの大きなシフトを示しています。著者は "meat.dev" というツールを作成することでこれを例示しました。このツールは大規模言語モデル(LLM)を使用して、差分からインポートやボイラープレートなど重要なコードを取り除き、開発者がコアアーキテクチャとエッジケース(「the meat」)に集中できるようにします。Shelley 内の発見可能なスキルとして構築されたこのエージェントは、単一のプロンプトでバックグラウンドスインジングなどの複雑なロジックを統合することを可能にし、手動のコマンドライン実行の必要性を排除します。さらに、エージェントによるパーソナライゼーションは学習曲線を劇的に削減し、ソリューションが「機能しているように見える」場合、大規模なレビューなしに小規模チームや個人開発者向けのカスタムソフトウェア(例:セルフホストされたブログ)を可能にします。Claude Code などのクローズドソースツールはソースコードへのアクセスを欠いているのに対し、オープンソースのエージェントはハードコーディングされた値の直接修正や Monobit を通じたビットマップフォントのようなカスタムアセットの統合、またはオンデマンドでの固有リソースの生成を可能にします。このシフトは、開発をレガシーなプラグインエコシステムと設定中心のワークフローから遠ざけ、自動化が効率的に日常運用を管理する一方で人間がコアアーキテクチャに完全に集中する未来へと導きます。

2026/08/04 2:08

より小さく、高速で、安全に:Kim i と G L M を大規模に展開するための実行方法

## Japanese Translation: Workers AI は、Cloudflare のインフラストラクチャ上で大規模な AI モデルの提供を進めており、NVIDIA Blackwell GPU と SGLang フレームワークを活用することでコストを大幅に削減するとともに速度を向上させながら精度を維持しています。本ソリューションは、モデル重みの圧縮、KV キャッシュメモリへの量子化、共有メモリの保護を実現するための整合性チェックという 3 つの中核技術を採用しています。 モデル重みについては、Workers AI がハイブリッド戦略を採用しており、応答のデコードには低精度の INT4 形式を使用します(GLM モデルでは約 60% のメモリ使用量削減を実現しながら、全精度重みから機能的不可能区別性 を維持)。一方、初期処理には高精度な形式を留保しています。KV キャッシュについては、BF16 から 8 ビット FP8 への量子化によりメモリサイズが半分になり、コンテキスト容量が倍増します(例えば、約 137 万トークンの対応が可能になり、従来の約 686 千トークンから)。MMLU や GSM8K などの主要なベンチマークにおける精度劣化はありません。 莫大な同時接続下での安定性を確保するため、Workers AI は共有 KV キャッシュに対して汎用整合性チェックを実装しており、数百件のリクエストが物理メモリページを共有する際のエラーを防いでいます。これにより、スループットおよびレイテンシに対するオーバーヘッドは 1% も未満です。これらの最適化により、同時接続制限が倍増し(例えば、64 つの同時リクエストへの対応が可能になり、従来の 32 から)、運用コストを約 30% 削減するとともに、モデルの信頼性を損なうことなくデコード速度を大幅に向上させることが可能になりました。技術が進化するにつれ、Workers AI は効率的なグローバル展開を実現するために新たな精度形式の検証を継続しています。

ComfyUI で MiniMax H3 の Day-0 サポート導入:オープンウェイト、ネイティブ音声対応、2K 動画生成 | そっか~ニュース