ComfyUI 中的 MiniMax H3 Fun ControlNet Union 2.0:八种控制类型
阿里 PAI 为 MiniMax H3 打造的 ControlNet Union 2.0 新增 Scribble、Layout 和 Gray 控制,并将注入模块数量翻倍,ComfyUI 同日提供支持。
上一个 checkpoint(MiniMax H3 Fun ControlNet Union,2026 年 8 月 24 日)提供了 Canny、Depth、HED、MLSD 和 Pose,并带有五个控制块。2.0 版本保留该接口并重建了控制分支:新 checkpoint 约 13.5 GB,ComfyUI 在发布当天即原生支持。
2.0 有哪些变化
| v1(2026 年 8 月) | v2.0(本次发布) | |
|---|---|---|
| 控制条件 | 5 种:Canny、Depth、HED、MLSD、Pose | 8 种:新增 Scribble、Layout、Gray |
| 控制分支深度 | 5 个控制块(0, 10, 20, 30, 40) | 10 个控制块(0, 5, 10, ..., 45) |
| 图像修复的掩码像素方案 | pre_norm(空洞 ≈ -2,接近黑色) | post_norm(空洞为 0,中灰) |
| Checkpoint 内容 | control_proj_in + 5 个块(约 6.8 GB) | control_proj_in + 10 个块(约 13.5 GB) |
| 必填配置 | minimax_h3_control.yaml | minimax_h3_control_inpaint_post_norm.yaml |
其余部分全部沿用:control_in_dim = 49(Latent + 掩码 Latent + 掩码,因此单个分支即可同时处理控制与图像修复)、control_apply_audio = false、可在 guidance_scale = 1.0 下运行的引导蒸馏权重,以及接入主分支的零门控跳跃相加。
注入布局是此次值得注意的变化。控制信号现在接入 50 个 transformer 块中的 10 个,而非 5 个,注入点大致翻倍,模型卡认为这带来了更紧密的结构贴合度。
八种控制条件
| 条件 | 控制信号 | 2.0 新增 |
|---|---|---|
| Canny | Canny 边缘图 | |
| Depth | 单目深度图 | |
| HED | HED 边缘检测 | |
| MLSD | 线段检测 | |
| Pose | DWPose 骨骼 | |
| Scribble | 手绘或草图线条 | ✅ |
| Layout | 边界框布局视频 | ✅ |
| Gray | 灰度(亮度)视频 | ✅ |
Layout 沿用 Wan2.1-VACE 的布局方案:将每个主体的框渲染为白色背景上的彩色编码矩形,并作为普通 RGB 视频输入。生成视频在帧数(向下取整到视频 VAE 能解码的最大 17 * n + 5,上限 15 秒)、宽高比和固定 24 fps 上跟随控制视频。
在 ComfyUI 中运行
ComfyUI 通过 PR #16471(CORE-462,2026 年 9 月 22 日合并)获得对新 checkpoint 的支持,该 PR 在三处更新了 MiniMax H3 控制路径:
comfy/ldm/minimax/controlnet.py学会识别inpaint_post_norm标志,因此掩码像素在 VAE 归一化之后而非之前被置零。comfy_extras/nodes_minimax_h3.py在该标志启用时把 ImageNet 均值加回掩码区域,与 2.0 checkpoint 的训练方式保持一致。comfy_extras/nodes_model_patch.py现在从 checkpoint 自身推导注入层(range(0, 50, 50 // num_blocks)),因此同一个加载器可同时处理 5 块 v1 与 10 块 v2.0 权重文件。
在节点图中你使用与之前相同的两个节点:ModelPatchLoader 用于控制分支,MiniMaxH3FunControlNetApply 将控制视频绑定到采样器。发布的 checkpoint 是原始控制分支,因此 ComfyUI 用户应改为加载 Kijai 的 MiniMax H3 仓库中的转换后模型补丁:
- minimax_h3_fun_controlnet_union_2.0_pruned_bf16.safetensors
- minimax_h3_fun_controlnet_union_2.0_pruned_int8_convrot.safetensors
ComfyUI 自带的官方模板 video_minimax_h3_fun_controlnet_union 已经接好了姿态控制的完整链路(分辨率选择器、H3 参考生视频节点、VAE 对、SDPose 视频姿态预处理子图以及采样器)。把 ModelPatchLoader 中的补丁文件换成 2.0 版本,即可运行新 checkpoint。
ComfyUI 官方姿态控制模板随附的预览效果图
同一模板的另一张预览效果图
效果展示
模型卡为每种条件都发布了一段控制视频和一份已生成输出,全部使用 40 步推理,guidance_scale = 1.0 且 control_context_scale = 1.00。下面每组中左图为控制信号,右图为输出结果。
![]() | ![]() |
|---|---|
| Pose 控制视频 | 已生成输出 |
![]() | ![]() |
|---|---|
| Layout 控制视频(2.0 新增) | 已生成输出 |
![]() | ![]() |
|---|---|
| Scribble 控制视频(2.0 新增) | 已生成输出 |
完整视频片段(包括图像修复对照)位于模型页面。
可用性
与 v1 一样,该 checkpoint 通过 VideoX-Fun 推理管线运行:克隆 VideoX-Fun,将基础 MiniMax H3 模型和 13.5 GB 的控制分支放到 models/Diffusion_Transformer/ 下,并让 examples/minimax_h3_fun/predict_v2v_control.py 指向新权重。模型卡特别指出了一个陷阱:用 v1 配置(minimax_h3_control.yaml)加载 2.0 checkpoint 会静默失败,因为只会构建一半控制分支,于是 control_blocks.5~9 会被当作意外键丢弃,其余部分也会错位。请务必使用 minimax_h3_control_inpaint_post_norm.yaml。
control_context_scale 仍会在每个控制跳跃连接加到主分支之前对其进行缩放:1.0 表示最强控制,较低数值表示更弱的引导,0.0 则完全关闭控制分支。






评论
使用 GitHub 登录后即可参与讨论。