ComfyUI 中的 MiniMax H3 Fun ControlNet Union 2.0:八种控制类型

ComfyUI Wikinews

阿里 PAI 为 MiniMax H3 打造的 ControlNet Union 2.0 新增 Scribble、Layout 和 Gray 控制,并将注入模块数量翻倍,ComfyUI 同日提供支持。

MiniMax H3 Fun ControlNet Union 2.0Hugging Face | VideoX-Fun | ComfyUI PR #16471)是阿里 PAI 为 MiniMax H3 打造的 ControlNet-Union 第二个版本,于 2026 年 9 月 22 日发布。它从五种控制条件扩展到 八种,新增 Scribble、Layout 和 Gray,并将基础 transformer 中的控制注入点数量翻倍。

上一个 checkpoint(MiniMax H3 Fun ControlNet Union,2026 年 8 月 24 日)提供了 Canny、Depth、HED、MLSD 和 Pose,并带有五个控制块。2.0 版本保留该接口并重建了控制分支:新 checkpoint 约 13.5 GB,ComfyUI 在发布当天即原生支持。

2.0 有哪些变化

v1(2026 年 8 月)v2.0(本次发布)
控制条件5 种:Canny、Depth、HED、MLSD、Pose8 种:新增 Scribble、Layout、Gray
控制分支深度5 个控制块(0, 10, 20, 30, 4010 个控制块0, 5, 10, ..., 45
图像修复的掩码像素方案pre_norm(空洞 ≈ -2,接近黑色)post_norm(空洞为 0,中灰)
Checkpoint 内容control_proj_in + 5 个块(约 6.8 GB)control_proj_in + 10 个块(约 13.5 GB)
必填配置minimax_h3_control.yamlminimax_h3_control_inpaint_post_norm.yaml

其余部分全部沿用:control_in_dim = 49(Latent + 掩码 Latent + 掩码,因此单个分支即可同时处理控制与图像修复)、control_apply_audio = false、可在 guidance_scale = 1.0 下运行的引导蒸馏权重,以及接入主分支的零门控跳跃相加。

注入布局是此次值得注意的变化。控制信号现在接入 50 个 transformer 块中的 10 个,而非 5 个,注入点大致翻倍,模型卡认为这带来了更紧密的结构贴合度。

八种控制条件

条件控制信号2.0 新增
CannyCanny 边缘图
Depth单目深度图
HEDHED 边缘检测
MLSD线段检测
PoseDWPose 骨骼
Scribble手绘或草图线条
Layout边界框布局视频
Gray灰度(亮度)视频

Layout 沿用 Wan2.1-VACE 的布局方案:将每个主体的框渲染为白色背景上的彩色编码矩形,并作为普通 RGB 视频输入。生成视频在帧数(向下取整到视频 VAE 能解码的最大 17 * n + 5,上限 15 秒)、宽高比和固定 24 fps 上跟随控制视频。

在 ComfyUI 中运行

ComfyUI 通过 PR #16471(CORE-462,2026 年 9 月 22 日合并)获得对新 checkpoint 的支持,该 PR 在三处更新了 MiniMax H3 控制路径:

  • comfy/ldm/minimax/controlnet.py 学会识别 inpaint_post_norm 标志,因此掩码像素在 VAE 归一化之后而非之前被置零。
  • comfy_extras/nodes_minimax_h3.py 在该标志启用时把 ImageNet 均值加回掩码区域,与 2.0 checkpoint 的训练方式保持一致。
  • comfy_extras/nodes_model_patch.py 现在从 checkpoint 自身推导注入层(range(0, 50, 50 // num_blocks)),因此同一个加载器可同时处理 5 块 v1 与 10 块 v2.0 权重文件。

在节点图中你使用与之前相同的两个节点:ModelPatchLoader 用于控制分支,MiniMaxH3FunControlNetApply 将控制视频绑定到采样器。发布的 checkpoint 是原始控制分支,因此 ComfyUI 用户应改为加载 Kijai 的 MiniMax H3 仓库中的转换后模型补丁:

ComfyUI 自带的官方模板 video_minimax_h3_fun_controlnet_union 已经接好了姿态控制的完整链路(分辨率选择器、H3 参考生视频节点、VAE 对、SDPose 视频姿态预处理子图以及采样器)。把 ModelPatchLoader 中的补丁文件换成 2.0 版本,即可运行新 checkpoint。

MiniMax H3 Fun ControlNet Union 官方模板预览图

ComfyUI 官方姿态控制模板随附的预览效果图

MiniMax H3 Fun ControlNet Union 官方模板预览图(第二张)

同一模板的另一张预览效果图

效果展示

模型卡为每种条件都发布了一段控制视频和一份已生成输出,全部使用 40 步推理,guidance_scale = 1.0control_context_scale = 1.00。下面每组中左图为控制信号,右图为输出结果。

Pose 控制Pose 输出
Pose 控制视频已生成输出
Layout 控制Layout 输出
Layout 控制视频(2.0 新增)已生成输出
Scribble 控制Scribble 输出
Scribble 控制视频(2.0 新增)已生成输出

完整视频片段(包括图像修复对照)位于模型页面

可用性

与 v1 一样,该 checkpoint 通过 VideoX-Fun 推理管线运行:克隆 VideoX-Fun,将基础 MiniMax H3 模型和 13.5 GB 的控制分支放到 models/Diffusion_Transformer/ 下,并让 examples/minimax_h3_fun/predict_v2v_control.py 指向新权重。模型卡特别指出了一个陷阱:用 v1 配置(minimax_h3_control.yaml)加载 2.0 checkpoint 会静默失败,因为只会构建一半控制分支,于是 control_blocks.5~9 会被当作意外键丢弃,其余部分也会错位。请务必使用 minimax_h3_control_inpaint_post_norm.yaml

control_context_scale 仍会在每个控制跳跃连接加到主分支之前对其进行缩放:1.0 表示最强控制,较低数值表示更弱的引导,0.0 则完全关闭控制分支。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
ComfyUI 中的 MiniMax H3 Fun ControlNet Union 2.0:八种控制类型 | ComfyUI Wiki