MiniMax H3 Fun ControlNet Union:一个检查点支持Canny、Depth、Pose等多种控制
阿里云PAI为MiniMax H3发布ControlNet-Union:一个6.8 GB检查点即可通过VideoX-Fun实现Canny、Depth、HED、MLSD和Pose视频控制及视频修复。
它是什么
该检查点只包含控制分支(control_proj_in 加五个 control_blocks,约 6.8 GB),加载在 MiniMax H3 基础 Transformer 之上。控制信号注入到 50 个 Transformer 块中的五个(第 0、10、20、30、40 层),每个控制跳跃通过零门控投影加入主分支。
- Union 控制 — 一个检查点即可处理 Canny、Depth、HED、MLSD 和 Pose 控制视频,用于视频到视频生成。
- 引导蒸馏 — 以
guidance_scale = 1.0运行,每步只需一次前向传播,无需 classifier-free guidance。 - 视频修复 — 控制输入扩展到 49 通道(latent + 掩码 latent + mask);使用专用的
predict_v2v_control_inpaint.py示例。 - 控制强度 —
control_context_scale在控制跳跃加入主分支前对其进行缩放:1.0控制最强,数值越小控制越弱,0.0则关闭控制分支。
生成过程跟随控制视频:帧数自动收缩到视频 VAE 可解码的最大 17 × n + 5(时长上限 15 秒),画布在 height × width 像素预算内保持控制视频的宽高比,固定 24 fps。详细描述场景、主体和镜头的提示词可获得最稳定的结果。
效果展示
以下所有示例均以 40 步推理、guidance_scale = 1.0、control_context_scale = 1.00 生成。第一个视频是控制输入,第二个是生成输出。
Canny
Canny 控制输入(东京街头)
跟随 Canny 结构生成的输出
Pose
Pose 控制输入(舞蹈)
跟随舞蹈姿态生成的输出
可用性
该检查点目前通过 VideoX-Fun 推理流水线运行。克隆 VideoX-Fun 仓库,将 MiniMax H3 基础模型和本检查点放入 models/Diffusion_Transformer/,然后编辑 examples/minimax_h3_fun/predict_v2v_control.py 顶部的设置并运行:
model_name = "models/Diffusion_Transformer/MiniMax-H3"
config_path = "config/minimax_h3/minimax_h3_control.yaml"
transformer_path = "models/Diffusion_Transformer/MiniMax-H3-Fun-Controlnet-Union/MiniMax-H3-Fun-Controlnet-Union.safetensors"
control_video = "your_control_video.mp4"
prompt = "your prompt"python examples/minimax_h3_fun/predict_v2v_control.py模型卡中的重要配置说明:
- 配置必须与训练时完全一致地构建控制分支(
control_blocks_places: [0, 10, 20, 30, 40]、control_in_dim: 49、control_apply_audio: false);布局不匹配会导致检查点加载失败。 - 该检查点是引导蒸馏的:保持
guidance_scale = 1.0;大于 1 的值会重复应用引导并降低输出质量。 - 控制检查点只包含控制分支,必须存在 MiniMax-H3 基础权重。
- Transformer(约 62 GB)加 Qwen3-VL 文本编码器(约 62 GB)无法完整装入单张 80 GB GPU;请使用
model_group_offload或model_cpu_offload_and_qfloat8。
目前还没有原生支持 H3 ControlNet 的 ComfyUI 加载器——本次发布面向 VideoX-Fun 流水线。Gradio 演示 Space 展示了该模型及五个已发布的效果对比视频。
评论
使用 GitHub 登录后即可参与讨论。