From 9b243ff8561b4fd298ebb366b0e58543a675ef0b Mon Sep 17 00:00:00 2001 From: lin-bot23 Date: Sun, 2 Aug 2026 22:02:18 +0800 Subject: [PATCH 01/18] docs: add MiniMax H3 open-source workflow tutorial page (#1341) Add tutorials/video/minimax/minimax-h3.mdx covering the three native open-weights workflows (T2V, I2V, R2V) shipped with ComfyUI, including model downloads from Comfy-Org/MiniMax-H3, storage layout, and prompting tips. Update navigation for all four languages. --- docs.json | 24 +++ ja/tutorials/video/minimax/minimax-h3.mdx | 233 +++++++++++++++++++++ ko/tutorials/video/minimax/minimax-h3.mdx | 238 ++++++++++++++++++++++ tutorials/video/minimax/minimax-h3.mdx | 227 +++++++++++++++++++++ zh/tutorials/video/minimax/minimax-h3.mdx | 234 +++++++++++++++++++++ 5 files changed, 956 insertions(+) create mode 100644 ja/tutorials/video/minimax/minimax-h3.mdx create mode 100644 ko/tutorials/video/minimax/minimax-h3.mdx create mode 100644 tutorials/video/minimax/minimax-h3.mdx create mode 100644 zh/tutorials/video/minimax/minimax-h3.mdx diff --git a/docs.json b/docs.json index 1ffd2f6c5..180a9a28c 100644 --- a/docs.json +++ b/docs.json @@ -296,6 +296,12 @@ { "group": "Video", "pages": [ + { + "group": "MiniMax H3", + "pages": [ + "tutorials/video/minimax/minimax-h3" + ] + }, { "group": "LTX", "pages": [ @@ -3115,6 +3121,12 @@ { "group": "视频", "pages": [ + { + "group": "MiniMax H3", + "pages": [ + "zh/tutorials/video/minimax/minimax-h3" + ] + }, { "group": "LTX", "pages": [ @@ -5949,6 +5961,12 @@ { "group": "ビデオ", "pages": [ + { + "group": "MiniMax H3", + "pages": [ + "ja/tutorials/video/minimax/minimax-h3" + ] + }, { "group": "LTX", "pages": [ @@ -8867,6 +8885,12 @@ { "group": "비디오", "pages": [ + { + "group": "MiniMax H3", + "pages": [ + "ko/tutorials/video/minimax/minimax-h3" + ] + }, { "group": "LTX", "pages": [ diff --git a/ja/tutorials/video/minimax/minimax-h3.mdx b/ja/tutorials/video/minimax/minimax-h3.mdx new file mode 100644 index 000000000..289b1f09d --- /dev/null +++ b/ja/tutorials/video/minimax/minimax-h3.mdx @@ -0,0 +1,233 @@ +--- +title: "MiniMax H3: ComfyUI ワークフロー例" +description: "オープンウェイトのMiniMax H3をComfyUIで使用する方法を学びます。テキストから動画へ、画像から動画へ、参照から動画へのネイティブワークフローを備え、すべてネイティブのステレオオーディオに対応しています。" +sidebarTitle: "MiniMax H3" +translationSourceHash: a19ad880 +translationFrom: tutorials/video/minimax/minimax-h3.mdx +translationBlockHashes: + "_intro": 4473c3b1 + "Key features": 7bfa7de1 + "Getting started": fddf949c + "Setting the output resolution": 08aa2b8b + "ComfyUI Native Workflows": 2f82c442 +--- + + + +[MiniMax H3](https://www.minimax.io/blog/minimax-h3) は、MiniMaxの汎用オムニモーダル生成モデルで、現在はオープンウェイトとして公開されています。テキスト、画像、ビデオ、オーディオを単一のコンテキストで統合的に理解し、**ネイティブステレオオーディオ**付きのビデオを生成します。つまり、音声、サウンドエフェクト、音楽は、後から重ね合わせるのではなく、単一のフォワードパスでまとめてモデル化されます。出力は最大2K解像度、24fps、約15秒です。 + +ComfyUIには、MiniMax H3用のネイティブワークフローが3つ同梱されており、それぞれ特定の生成モード向けに設計されています: + +- **テキストから動画へ**(T2V): テキストプロンプトからビデオを生成 +- **画像から動画へ**(I2V): 入力画像からビデオを生成。オプションで先頭/末尾フレームの制御が可能 +- **参照から動画**(R2V): 参照画像、ビデオ、オーディオから、キャラクター、スタイル、モーション、カメラワーク、または音声を固定したビデオを生成 + + + +## 主な機能 + +- **ネイティブステレオオーディオ**: 会話、効果音、音楽がビデオと一緒に生成され、1つのMP4に同期されます +- **マルチモーダルコンテキスト**: テキスト、画像、ビデオ、オーディオリファレンスを1回の生成で組み合わせることができます +- **リファレンス駆動の生成**: リファレンス素材からキャラクターのアイデンティティ、スタイル、モーション、カメラの動き、または音声を固定できます +- **指示への追従**: リファレンスと目的のショットの関係を自然言語で記述します +- **正確なテキストレンダリング**: スペルアウトされたテキストとブランド要素がきれいにレンダリングされます +- **オープンウェイト**: ComfyUIでローカルに実行でき、すべてのパラメータを完全に制御できます + +## はじめに + +MiniMax H3はオープンウェイトで、ComfyUIでサポートされています。はじめるには: + +1. ComfyUI を 0.30.0 以降に更新します +2. **テンプレートライブラリ** > **ビデオ** の順に移動し、任意のMiniMax H3ワークフローを選択します +3. ポップアップに従ってモデルをダウンロードし、ワークフローを実行します + +モデルファイルは Hugging Face の [Comfy-Org/MiniMax-H3](https://huggingface.co/Comfy-Org/MiniMax-H3) リポジトリでホストされています。 + +## 出力解像度の設定 + +各ワークフローでは、**Resolution Selector(解像度セレクタ)** ノードを使って全体の出力サイズを制御します。このノードは3つの設定から `width` と `height` を計算し、その出力は MiniMax H3 ノードの `width` と `height` 入力に直接接続されます: + +- **アスペクト比**:`16:9 (Widescreen)`、`9:16 (Portrait Widescreen)`、`1:1 (Square)` などのプリセットを選択します +- **メガピクセル**:出力の目標総ピクセル数。値が大きいほど大きなフレームになり、小さいほど高速に生成されます +- **倍数**:計算された解像度はこの数値の最も近い倍数に丸められます。H3 の解像度グリッドに合わせて `32` のままにします + +テンプレートは高速なプレビューサイズになっています。フル品質で出力するには、16:9 でメガピクセルを約 `1.0` に上げると、およそ 1344x768 になります。これは H3 のネイティブキャンバス(短辺 768px、上限 768x1344 ピクセル)です。 + +## ComfyUI のネイティブワークフロー + +### MiniMax H3 テキストからビデオ生成 (T2V) + +テキストプロンプトから、ネイティブのステレオオーディオ付きビデオを生成します。 + + + + + + Comfy Cloud で開く + + + JSON をダウンロードするか、テンプレートライブラリで「MiniMax H3 T2V」を検索してください + + + +#### モデルのダウンロード + + + + ComfyUI/models/diffusion_models/ に配置してください + + + ComfyUI/models/text_encoders/ に配置してください + + + ComfyUI/models/vae/ に配置してください + + + ComfyUI/models/vae/ に配置してください + + + +#### モデルの保存場所 + +``` +ComfyUI/ +├── 📂 models/ +│ ├── 📂 diffusion_models/ +│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors +│ ├── 📂 text_encoders/ +│ │ └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors +│ └── 📂 vae/ +│ ├── minimax_h3_video_vae_fp16.safetensors +│ └── minimax_h3_audio_vae_fp32.safetensors +``` + +#### プロンプト作成のヒント + +1. **シーン全体を記述する**: まずシーン全体(場所、キャラクター、何が起きているか)を説明し、次に時間単位のショットに分割します +2. **ショット、カメラ、オーディオ**: ショット、カメラの動き、それに伴うオーディオ(セリフ、効果音、音楽)を1つのプロンプトブロックにまとめて記述します +3. **解像度**: H3 のネイティブキャンバスは短辺 768px で、上限は 768x1344 ピクセルであり、32 の倍数に丸められます +4. **再生時間**: 再生時間の入力は、24fps におけるモデルの 17 フレーム単位のブロック(17k+5)のグリッドにスナップされます +5. **先頭/末尾フレーム**: `MiniMaxH3ImageToVideo` ノードの `first_frame` や `last_frame` に画像を接続すると、このワークフローを先頭/末尾フレームの画像から動画への変換に利用できます + +---### MiniMax H3 画像からビデオへ (I2V) + +入力画像からビデオを生成します。最初と最後のフレームのキーフレームをオプションで指定できます。 + + + + + + Comfy Cloud で開く + + + JSON をダウンロードするか、テンプレートライブラリで「MiniMax H3 I2V」を検索してください + + + + + + デフォルトの入力画像をダウンロードするか、ご自身の画像を使用してください。 + + + +#### モデルのダウンロード + + + + ComfyUI/models/diffusion_models/ に配置してください + + + ComfyUI/models/text_encoders/ に配置してください + + + ComfyUI/models/vae/ に配置してください + + + ComfyUI/models/vae/ に配置してください + + + +#### モデルの保存場所 + +``` +ComfyUI/ +├── 📂 models/ +│ ├── 📂 diffusion_models/ +│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors +│ ├── 📂 text_encoders/ +│ │ └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors +│ └── 📂 vae/ +│ ├── minimax_h3_video_vae_fp16.safetensors +│ └── minimax_h3_audio_vae_fp32.safetensors +``` + +#### プロンプトのヒント + +1. **キーフレーム**: `first_frame` と `last_frame` の入力はオプションです。モデルはこれらの間の動きを生成します +2. **プロンプト**: ショット、動き、および付随するオーディオ(会話、効果音、音楽)を 1 つのブロックで記述します +3. **解像度**: H3 のネイティブキャンバスは短辺 768px で、768x1344 ピクセルに制限され、32 の倍数に丸められます +4. **再生時間**: 再生時間の入力は、24fps におけるモデルの 17 フレーム単位のブロック(17k+5)グリッドにスナップします + +---### MiniMax H3 参照からビデオ生成(R2V) + +参照画像、ビデオ、オーディオの任意の組み合わせから、キャラクター、スタイル、モーション、カメラワーク、音声を固定したビデオを生成します。 + + + + + + Comfy Cloud で開く + + + JSON をダウンロードするか、テンプレートライブラリで「MiniMax H3 R2V」を検索してください + + + + + + このワークフロー用のキャラクター参照です。ご自身の画像を使用することもできます。 + + + このワークフロー用のスタイルと被写体の参照です。ご自身の画像を使用することもできます。 + + + +#### モデルのダウンロード + + + + ComfyUI/models/diffusion_models/ に配置してください + + + ComfyUI/models/text_encoders/ に配置してください + + + ComfyUI/models/vae/ に配置してください + + + ComfyUI/models/vae/ に配置してください + + + +#### モデルの保存場所 + +``` +ComfyUI/ +├── 📂 models/ +│ ├── 📂 diffusion_models/ +│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors +│ ├── 📂 text_encoders/ +│ │ └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors +│ └── 📂 vae/ +│ ├── minimax_h3_video_vae_fp16.safetensors +│ └── minimax_h3_audio_vae_fp32.safetensors +``` + +#### プロンプトのヒント + +1. **タグによる参照**: 各入力を、接続された順序どおりにタグで参照します。例: ``、`