ComfyUI 中的 MiniMax H3:完整视频生成指南
在 ComfyUI 中下载并运行 MiniMax H3:T2V、I2V 和 R2V 工作流,官方模型与 VAE 文件,GGUF/INT8/NVFP4 量化选项,性能优化技巧与故障排查。
教程概述
本教程涵盖了在 ComfyUI 中运行 MiniMax H3 所需的全部内容:安装模型、加载官方工作流、了解三种生成模式(T2V、I2V、R2V)、选择合适的分辨率以及解决常见问题。
MiniMax H3 模型概述
MiniMax H3 是 MiniMax Hailuo 视频系列中的最新模型。它可生成最长 15 秒、24 FPS 的视频,支持原生 32 kHz 立体声音频,覆盖 11 种语言,最高分辨率可达 2K。该模型由 33.1B 密集单流全能变压器(omni transformer)驱动,并配备 Qwen3-VL-32B 文本编码器。
主要功能:
- 原生立体声音频:对话、音效和音乐与视频一同生成,无需单独的音频模型
- 全能模态上下文:支持文本、图像、视频和音频的任意组合作为输入
- 三种任务模式:文生视频(T2V)、图生视频(I2V)和参考生视频(R2V)
- 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语
- 开放权重:MiniMax H3 社区许可证,完全本地推理
开放版本包含 H3-Base 的两个模型:FL2VA(文生视频及首尾帧条件)和 Ref2VA(基于参考的生成)。H3-Context-IR 预处理系统和 H3-Regenerate-2K 2K 图像放大模块仍为托管 API。
入门
ComfyUI 已支持开放权重的 MiniMax H3:
- 更新 ComfyUI 至最新版本(0.30.0 或更高版本;原生支持已合入 Comfy-Org/ComfyUI #15224)
- 打开
工作流->浏览模板->视频,然后选择任意 MiniMax H3 工作流 - 按照弹窗提示下载模型并运行工作流
模型文件托管在 Hugging Face 的 Comfy-Org/MiniMax-H3 仓库中。
模型安装
从 Comfy-Org/MiniMax-H3 下载以下文件,并将它们放入对应的文件夹中:
Diffusion 模型(选择其中一个变体):
| 模型 | 大小 | 备注 |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 19.5 GB | 推荐:剪枝 INT8,体积缩小约 40%,T2V/I2V 的最佳平衡选择 |
minimax_h3_fl2va_int8_convrot.safetensors | 31.7 GB | 标准 INT8 |
minimax_h3_fl2va_bf16.safetensors | 61.7 GB | 全精度 |
minimax_h3_ref2va_pruned_int8_convrot.safetensors | 19.5 GB | 用于参考生视频(R2V)模式 |
minimax_h3_ref2va_bf16.safetensors | 61.7 GB | 全精度 R2V |
文本编码器(选择其中一个):
| 模型 | 大小 | 备注 |
|---|---|---|
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 14.6 GB | 推荐:NVFP4 AWQ,可在任何 GPU 上运行 |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 25.3 GB | INT8 convrot |
qwen3vl_32b_minimax_h3_bf16.safetensors | 48.0 GB | 全精度 |
VAE(两个均为必填):
| 模型 | 大小 |
|---|---|
minimax_h3_video_vae_fp16.safetensors | 4.9 GB |
minimax_h3_audio_vae_fp32.safetensors | 0.6 GB |
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors官方工作流
通过 Comfy-Org/workflow_templates 提供了六个官方模板。其中三个在本地运行(开放权重),另外三个调用 MiniMax API。本指南将按照官方 Comfy-Org 文档,详细介绍这三个本地工作流。
加载工作流
方法 1:模板图库(推荐)
将 ComfyUI 更新到最新版本,然后通过 工作流 -> 浏览模板 -> 视频 -> MiniMax H3 加载。
方法 2:下载并拖入
下载 JSON 并将其拖入 ComfyUI 窗口。
设置输出分辨率
每个工作流都使用分辨率选择器节点,根据三个设置计算 width 和 height:
- 纵横比:预设,例如 16:9(横屏)、9:16(竖屏)或 1:1(方形)
- 百万像素:目标总像素数;数值越高,生成的画面越大,数值越低运行速度越快
- 倍数:四舍五入到该数字的最近倍数;保持为 32 以匹配 H3 的分辨率网格
H3 的原生画布短边为 768px,上限为 768x1344 像素,并四舍五入到 32 的倍数。模板自带快速预览尺寸;如需全质量,请在 16:9 下将百万像素提高到约 1.0,即可获得约 1344x768 的分辨率。
1. MiniMax H3 文生视频(T2V)
根据文本提示生成视频,并带有原生立体声音频。
模型下载(T2V)
| 组件 | 文件 | 目标位置 |
|---|---|---|
| Diffusion 模型 | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
模型存储(T2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors提示词技巧(T2V)
- 描述整个场景:先说明整体场景(地点、角色、正在发生的事情),再将其拆分为按时间划分的镜头
- 镜头、相机和音频:在同一个提示词区块中描述镜头、相机运动以及伴随的音频(对白、音效、音乐)
- 时长:时长输入会吸附到模型在 24 FPS 下的 17 帧/块(17k+5)网格上
- 首帧/末帧:将图像连接到
MiniMaxH3ImageToVideo节点上的first_frame和/或last_frame,即可将该工作流转换为首帧/末帧图生视频
2. MiniMax H3 图生视频(I2V)
从输入图像生成视频,并可选择使用首帧/末帧关键帧。
输入图像:
- 下载默认输入图像,或使用您自己的图像。
模型下载(I2V)
| 组件 | 文件 | 目标位置 |
|---|---|---|
| Diffusion 模型 | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
模型存储(I2V)
布局与 T2V 工作流相同(FL2VA Diffusion 模型 + NVFP4 文本编码器 + 两个 VAE)。
提示词技巧(I2V)
- 关键帧:
first_frame和last_frame输入为可选项;模型生成它们之间的运动 - 提示词:在同一个提示块中描述镜头、运动以及伴随的音频(对话、音效、音乐)
- 时长:在 24 FPS 下对齐到每块 17 帧(17k+5)的网格
3. MiniMax H3 参考生视频 (R2V)
根据参考图像、视频和音频的任意组合,生成可锁定角色、风格、运动、相机运动或声音的视频。
参考图像:
- 工作流的角色参考图,或使用您自己的图像
- 工作流的风格和主体参考图,或使用您自己的图像
模型下载 (R2V)
| 组件 | 文件 | 目标位置 |
|---|---|---|
| 扩散模型 | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
模型存储 (R2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors提示词技巧 (R2V)
- 按标签引用参考:按照连接时的确切顺序,通过标签引用每个输入,例如
<Picture 1>、<Video 1>、<Audio 1> - 为每个参考分配任务:明确说明哪个参考驱动镜头的哪个部分(身份、风格、运动、相机、声音);明确的分配效果要好得多
- 限制:最多 9 张参考图像、3 段参考视频(每段可自带音轨)和 3 段独立的参考音频片段
- ref_image_size:
match会将参考图缩小到生成分辨率以提升速度;max保留最长 2048 像素的短边,以获得更强的身份保真度,但会牺牲速度 - 采样器:对于参考内容较多的提示词,
res_multistep搭配beta或normal调度器往往优于simple - 注意:R2V 使用
ref2va扩散模型,与 T2V 和 I2V 使用的fl2va模型权重不同
API 工作流
另外三个官方模板调用 MiniMax API,而不是在本地运行:
| 模板 | 模式 |
|---|---|
| api_minimax_h3_t2v.json | API:文本转视频 |
| api_minimax_h3_r2v.json | API:参考转视频 |
| api_minimax_h3_flf2v.json | API:首帧/尾帧转视频 |
故障排查
ComfyUI-MiniMaxH3-Cache。 该自定义节点会全局 monkey-patch MiniMax H3 模型代码,可能在 ComfyUI 更新后破坏 H3 生成(甚至破坏 ComfyUI 本身),即使从未使用过它。参见 lihaoyun6/ComfyUI-MiniMaxH3-Cache#4。如果已经安装,请从 custom_nodes/ 中删除并重启 ComfyUI。
问:ComfyUI 不显示 MiniMax H3 节点
将 ComfyUI 更新到 0.30.0 或更高版本。原生支持已于 2026 年 8 月 3 日合入 Comfy-Org/ComfyUI #15224。桌面端和云端更新会跟随稳定版发布,因此某些每夜版支持的功能可能尚不可用。
问:内存不足 / 高显存占用
- 使用 精简版 INT8 扩散模型(19.5 GB),而不是 bf16
- 使用 NVFP4 AWQ 文本编码器(14.6 GB),它可以在任何 GPU 上运行
- 在分辨率选择器节点中降低分辨率(降低兆像素数)并缩短时长
- 在系统内存充足的机器上,ComfyUI 的动态显存系统和块交换功能会有所帮助
问:在 256p 或非常小的分辨率下生成失败
H3 的最低分辨率为 384p。256p 会完全失败。请使用官方模板中的分辨率预设。
问:输出视频没有音频
确保两个 VAE 均已加载:minimax_h3_video_vae_fp16.safetensors(视频)和 minimax_h3_audio_vae_fp32.safetensors(音频),并且工作流中包含连接到 SaveVideo 的 VAEDecodeAudio 节点。
问:图生视频应该使用哪个 checkpoint?
对于 T2V 和 I2V(首帧、末帧或两者),请使用 FL2VA checkpoint。当需要完整的基于参考的生成(身份、风格、声音)时,请使用 Ref2VA checkpoint。
问:在哪里可以反馈 bug?
- 运行时错误:ComfyUI/issues
- UI 问题:ComfyUI_frontend/issues
MiniMax H3 性能优化提示
社区测试过的官方工作流加速设置:
- 采样器与调度器:
res_multistep搭配simple调度器、20 步是 T2V 和 I2V 的常用基线。降低步数可以节省时间,但低于约 15 步时画质会明显下降。提高到 25 步时,画面内容和动态会略好一些,但生成时间更长。 - Sage 注意力:使用
--use-sage-attention启动 ComfyUI(内置功能,无需自定义节点)。社区报告在中端 GPU 上生成速度可提升约 2 倍,但分辨率越高收益越小;结果因 GPU 而异。 - 分辨率:快速出片时可将分辨率选择器保持在 0.4 MP 左右(例如 768x512)。H3 在其 384p 最低分辨率下即可用,这远低于以往视频模型的要求。
- 固定内存:在 ComfyUI 0.30.x 上,固定内存回归可能导致模型加载非常慢。据报道,使用
--disable-pinned-memory启动可恢复快速加载,并在某些配置下显著缩短生成时间。
MiniMax H3 社区量化模型
可在原生 ComfyUI 中加载的 MiniMax H3 扩散模型社区量化版本。它们是第三方转换,并非 MiniMax 或 Comfy-Org 官方发布;请查看各仓库的 README 了解许可证和质量说明。
INT8
| 模型 | 说明 |
|---|---|
| DmitryDB/MiniMax-H3-INT8-Lean-ConvRot | 面向质量的 INT8 Lean ConvRot,FL2VA 和 Ref2VA 各约 20.9 GiB,专为 24 GB GPU 首选设计 |
| Gluttony10/MiniMax-H3-INT8-CONVROT | INT8 convrot 的 FL2VA 和 Ref2VA,附带音频/视频 VAE 和 INT8 Qwen3-VL 文本编码器 |
INT4
| 模型 | 说明 |
|---|---|
| Merserk/MiniMax-H3-INT4-ConvRot | 精简版 FL2VA 和 Ref2VA 各 11.3 GB,外加 INT4 文本编码器,面向 12 GB GPU |
| tsolful/Minimax_H3_INT4MixedConvRot | 混合精度 INT4 FL2VA,提供均衡(INT4BQ)和高画质(INT4Q)变体 |
NVFP4
| 模型 | 说明 |
|---|---|
| rockerBOO/minimax-h3-nvfp4 | FL2VA 的 NVFP4 和精简版 INT4 convrot 变体 |
| lilcheaty/MiniMax-H3-NVFP4 | NVFP4 的 FL2VA 和 Ref2VA 变体,包含混合精度 checkpoint |
| ModelsLab/MiniMax-H3-ref2va-NVFP4 | 用于参考工作流的 Ref2VA NVFP4 checkpoint |
FP8
| 模型 | 说明 |
|---|---|
| rzgar/minimax_h3_fl2va_fp8_e4m3fn | FP8 E4M3FN FL2VA;作者报告使用 dpmpp_2m / sgm_uniform 时 8 步为最佳平衡点 |
评论
使用 GitHub 登录后即可参与讨论。