ComfyUIでMiniMax H3 Fun ControlNet Union 2.0:8種類のコントロール
MiniMax H3向けAlibaba PAIのControlNet Union 2.0は、Scribble・Layout・Grayコントロールを追加し、注入ブロック数を倍増。ComfyUIも同日に対応しました。
以前のチェックポイント(MiniMax H3 Fun ControlNet Union、2026年8月24日)は、Canny、Depth、HED、MLSD、Poseを5つのコントロールブロックで提供していました。バージョン2.0はそのインターフェースを維持したままコントロールブランチを再構築しています。新しいチェックポイントは約13.5 GBで、ComfyUIは公開当日からネイティブにサポートしています。
2.0での変更点
| v1(2026年8月) | v2.0(今回のリリース) | |
|---|---|---|
| コントロール条件 | 5つ: Canny、Depth、HED、MLSD、Pose | 8つ: Scribble、Layout、Grayを追加 |
| コントロールブランチの深さ | 5つのコントロールブロック(0, 10, 20, 30, 40) | 10のコントロールブロック(0, 5, 10, ..., 45) |
| インペイントのマスクピクセル処理 | pre_norm(穴は ≈ -2、ほぼ黒) | post_norm(穴は 0、中間グレー) |
| チェックポイントの内容 | control_proj_in + 5ブロック(約6.8 GB) | control_proj_in + 10ブロック(約13.5 GB) |
| 必須config | minimax_h3_control.yaml | minimax_h3_control_inpaint_post_norm.yaml |
それ以外はすべて引き継がれています。control_in_dim = 49(latent + マスク済みlatent + マスクで、1つのブランチがコントロールとインペイントの両方を処理します)、control_apply_audio = false、guidance_scale = 1.0 で動作するガイダンス蒸留済みの重み、そしてメインブランチへのゼロゲート付きスキップ加算です。
注目すべき変更は注入レイアウトです。コントロール信号は50あるトランスフォーマーブロックのうち5つではなく10に接続されるようになり、注入ポイントがほぼ倍増しました。モデルカードでは、これにより構造への追従性が高まったとされています。
8つのコントロール条件
| 条件 | コントロール信号 | 2.0で新規 |
|---|---|---|
| Canny | Cannyエッジマップ | |
| Depth | 単眼深度マップ | |
| HED | HEDエッジ検出 | |
| MLSD | 線分検出 | |
| Pose | DWPoseスケルトン | |
| Scribble | フリーハンドまたはスケッチ線 | ✅ |
| Layout | バウンディングボックスのレイアウト動画 | ✅ |
| Gray | グレースケール(輝度)動画 | ✅ |
Layout は Wan2.1-VACE のレイアウトレシピに従います。被写体ごとのボックスが白背景に色分けされた矩形として描画され、通常のRGB動画として入力されます。生成側は、フレーム数(動画VAEがデコードできる最大の 17 * n + 5 に切り下げ、最大15秒)、アスペクト比、そして固定の24 fpsにおいてコントロール動画に従います。
ComfyUIでの実行
ComfyUIは PR #16471(CORE-462、2026年9月22日にマージ)で新しいチェックポイントのサポートを追加しました。このPRはMiniMax H3のコントロールパスを3か所で更新しています:
comfy/ldm/minimax/controlnet.pyがinpaint_post_normフラグを理解するようになり、マスクされたピクセルはVAE正規化の前にではなく後にゼロ化されます。comfy_extras/nodes_minimax_h3.pyは、このフラグが設定されているときにマスク領域へImageNet平均を加算し、2.0チェックポイントの学習時の挙動に一致させます。comfy_extras/nodes_model_patch.pyはチェックポイント自体から注入レイヤーを導出するようになり(range(0, 50, 50 // num_blocks))、1つのローダーで5ブロックのv1と10ブロックのv2.0の両方の重みファイルを扱えます。
グラフ内では以前と同じ2つのノードを使用します。コントロールブランチ用の ModelPatchLoader と、コントロール動画をサンプラーにバインドする MiniMaxH3FunControlNetApply です。公開されているチェックポイントは生のコントロールブランチなので、ComfyUIユーザーは代わりにKijaiのMiniMax H3リポジトリにある変換済みパッチのいずれかを読み込みます:
- minimax_h3_fun_controlnet_union_2.0_pruned_bf16.safetensors
- minimax_h3_fun_controlnet_union_2.0_pruned_int8_convrot.safetensors
ComfyUIに同梱されている公式テンプレート video_minimax_h3_fun_controlnet_union は、ポーズコントロール用のチェーン全体(解像度セレクター、H3参照から動画ノード、VAEペア、SDPose動画ポーズ前処理サブグラフ、サンプラー)をすでに配線済みです。ModelPatchLoader のパッチファイルを2.0ビルドに差し替えれば、新しいチェックポイントで動作します。
ComfyUI公式ポーズコントロールテンプレート付属のプレビュー画像
同じテンプレートのもう1枚のプレビュー画像
結果
モデルカードでは、各条件についてコントロール動画と生成出力が公開されています。すべて推論ステップ数40、guidance_scale = 1.0、control_context_scale = 1.00 で生成されています。以下の各ペアでは、左の画像がコントロール信号、右の画像が出力です。
![]() | ![]() |
|---|---|
| ポーズのコントロール動画 | 生成出力 |
![]() | ![]() |
|---|---|
| Layoutのコントロール動画(2.0で新規) | 生成出力 |
![]() | ![]() |
|---|---|
| Scribbleのコントロール動画(2.0で新規) | 生成出力 |
インペイントのペアを含む全クリップはモデルページで確認できます。
入手方法
チェックポイントはv1と同様、VideoX-Fun の推論パイプラインで動作します。VideoX-Fun をクローンし、ベースのMiniMax H3モデルと13.5 GBのコントロールブランチを models/Diffusion_Transformer/ に配置し、examples/minimax_h3_fun/predict_v2v_control.py を新しい重みに向けます。モデルカードは特に1つの落とし穴を指摘しています。2.0チェックポイントに対してv1のconfig(minimax_h3_control.yaml)を読み込むとサイレントに失敗します。コントロールブランチの半分しか構築されないため、control_blocks.5~9 は予期しないキーとして破棄され、残りも誤った位置に配置されます。常に minimax_h3_control_inpaint_post_norm.yaml を使用してください。
control_context_scale は引き続き、メインブランチに加算される前のすべてのコントロールスキップをスケーリングします。1.0 で最強のコントロール、より低い値で弱いガイダンス、0.0 でコントロールブランチを完全にオフにします。






コメント
GitHubでサインインしてディスカッションに参加しましょう。