ComfyUI 中的 MiniMax H3:完整视频生成指南
通过官方工作流掌握 ComfyUI 中的 MiniMax H3:T2V、I2V、R2V 模式,原生立体声音频,模型设置,分辨率指南,以及 AI 视频生成的故障排查。
教程概述
本教程涵盖了在 ComfyUI 中运行 MiniMax H3 所需的全部内容:安装模型、加载官方工作流、了解三种生成模式(T2V、I2V、R2V)、选择合适的分辨率以及解决常见问题。
MiniMax H3 模型概述
MiniMax H3 是 MiniMax Hailuo 视频系列中的最新模型。它可生成最长 15 秒、24 FPS 的视频,支持原生 32 kHz 立体声音频,覆盖 11 种语言,最高分辨率可达 2K。该模型由 33.1B 密集单流全能变压器(omni transformer)驱动,并配备 Qwen3-VL-32B 文本编码器。
主要功能:
- 原生立体声音频:对话、音效和音乐与视频一同生成,无需单独的音频模型
- 全能模态上下文:支持文本、图像、视频和音频的任意组合作为输入
- 三种任务模式:文生视频(T2V)、图生视频(I2V)和参考生视频(R2V)
- 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语
- 开放权重:MiniMax H3 社区许可证,完全本地推理
开放版本包含 H3-Base 的两个模型:FL2VA(文生视频及首尾帧条件)和 Ref2VA(基于参考的生成)。H3-Context-IR 预处理系统和 H3-Regenerate-2K 2K 图像放大模块仍为托管 API。
入门
ComfyUI 已支持开放权重的 MiniMax H3:
- 更新 ComfyUI 至最新版本(0.30.0 或更高版本;原生支持已合入 Comfy-Org/ComfyUI #15224)
- 打开
工作流->浏览模板->视频,然后选择任意 MiniMax H3 工作流 - 按照弹窗提示下载模型并运行工作流
模型文件托管在 Hugging Face 的 Comfy-Org/MiniMax-H3 仓库中。
模型安装
从 Comfy-Org/MiniMax-H3 下载以下文件,并将它们放入对应的文件夹中:
Diffusion 模型(选择其中一个变体):
| 模型 | 大小 | 备注 |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 19.5 GB | 推荐:剪枝 INT8,体积缩小约 40%,T2V/I2V 的最佳平衡选择 |
minimax_h3_fl2va_int8_convrot.safetensors | 31.7 GB | 标准 INT8 |
minimax_h3_fl2va_bf16.safetensors | 61.7 GB | 全精度 |
minimax_h3_ref2va_pruned_int8_convrot.safetensors | 19.5 GB | 用于参考生视频(R2V)模式 |
minimax_h3_ref2va_bf16.safetensors | 61.7 GB | 全精度 R2V |
文本编码器(选择其中一个):
| 模型 | 大小 | 备注 |
|---|---|---|
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 14.6 GB | 推荐:NVFP4 AWQ,可在任何 GPU 上运行 |
qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 25.3 GB | INT8 convrot |
qwen3vl_32b_minimax_h3_bf16.safetensors | 48.0 GB | 全精度 |
VAE(两个均为必填):
| 模型 | 大小 |
|---|---|
minimax_h3_video_vae_fp16.safetensors | 4.9 GB |
minimax_h3_audio_vae_fp32.safetensors | 0.6 GB |
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors官方工作流
通过 Comfy-Org/workflow_templates 提供了六个官方模板。其中三个在本地运行(开放权重),另外三个调用 MiniMax API。本指南将按照官方 Comfy-Org 文档,详细介绍这三个本地工作流。
加载工作流
方法 1:模板图库(推荐)
将 ComfyUI 更新到最新版本,然后通过 工作流 -> 浏览模板 -> 视频 -> MiniMax H3 加载。
方法 2:下载并拖入
下载 JSON 并将其拖入 ComfyUI 窗口。
设置输出分辨率
每个工作流都使用分辨率选择器节点,根据三个设置计算 width 和 height:
- 纵横比:预设,例如 16:9(横屏)、9:16(竖屏)或 1:1(方形)
- 百万像素:目标总像素数;数值越高,生成的画面越大,数值越低运行速度越快
- 倍数:四舍五入到该数字的最近倍数;保持为 32 以匹配 H3 的分辨率网格
H3 的原生画布短边为 768px,上限为 768x1344 像素,并四舍五入到 32 的倍数。模板自带快速预览尺寸;如需全质量,请在 16:9 下将百万像素提高到约 1.0,即可获得约 1344x768 的分辨率。
1. MiniMax H3 文生视频(T2V)
根据文本提示生成视频,并带有原生立体声音频。
模型下载(T2V)
| 组件 | 文件 | 目标位置 |
|---|---|---|
| Diffusion 模型 | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
模型存储(T2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors提示词技巧(T2V)
- 描述整个场景:先说明整体场景(地点、角色、正在发生的事情),再将其拆分为按时间划分的镜头
- 镜头、相机和音频:在同一个提示词区块中描述镜头、相机运动以及伴随的音频(对白、音效、音乐)
- 时长:时长输入会吸附到模型在 24 FPS 下的 17 帧/块(17k+5)网格上
- 首帧/末帧:将图像连接到
MiniMaxH3ImageToVideo节点上的first_frame和/或last_frame,即可将该工作流转换为首帧/末帧图生视频
2. MiniMax H3 图生视频(I2V)
从输入图像生成视频,并可选择使用首帧/末帧关键帧。
输入图像:
- 下载默认输入图像,或使用您自己的图像。
模型下载(I2V)
| 组件 | 文件 | 目标位置 |
|---|---|---|
| Diffusion 模型 | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
模型存储(I2V)
布局与 T2V 工作流相同(FL2VA Diffusion 模型 + NVFP4 文本编码器 + 两个 VAE)。
提示词技巧(I2V)
- 关键帧:
first_frame和last_frame输入为可选项;模型生成它们之间的运动 - 提示词:在同一个提示块中描述镜头、运动以及伴随的音频(对话、音效、音乐)
- 时长:在 24 FPS 下对齐到每块 17 帧(17k+5)的网格
3. MiniMax H3 参考生视频 (R2V)
根据参考图像、视频和音频的任意组合,生成可锁定角色、风格、运动、相机运动或声音的视频。
参考图像:
- 工作流的角色参考图,或使用您自己的图像
- 工作流的风格和主体参考图,或使用您自己的图像
模型下载 (R2V)
| 组件 | 文件 | 目标位置 |
|---|---|---|
| 扩散模型 | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ |
| VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
| VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
模型存储 (R2V)
ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── 📂 vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors提示词技巧 (R2V)
- 按标签引用参考:按照连接时的确切顺序,通过标签引用每个输入,例如
<Picture 1>、<Video 1>、<Audio 1> - 为每个参考分配任务:明确说明哪个参考驱动镜头的哪个部分(身份、风格、运动、相机、声音);明确的分配效果要好得多
- 限制:最多 9 张参考图像、3 段参考视频(每段可自带音轨)和 3 段独立的参考音频片段
- ref_image_size:
match会将参考图缩小到生成分辨率以提升速度;max保留最长 2048 像素的短边,以获得更强的身份保真度,但会牺牲速度 - 采样器:对于参考内容较多的提示词,
res_multistep搭配beta或normal调度器往往优于simple - 注意:R2V 使用
ref2va扩散模型,与 T2V 和 I2V 使用的fl2va模型权重不同
API 工作流
另外三个官方模板调用 MiniMax API,而不是在本地运行:
| 模板 | 模式 |
|---|---|
| api_minimax_h3_t2v.json | API:文本转视频 |
| api_minimax_h3_r2v.json | API:参考转视频 |
| api_minimax_h3_flf2v.json | API:首帧/尾帧转视频 |
故障排查
问:ComfyUI 不显示 MiniMax H3 节点
将 ComfyUI 更新到 0.30.0 或更高版本。原生支持已于 2026 年 8 月 3 日合入 Comfy-Org/ComfyUI #15224。桌面端和云端更新会跟随稳定版发布,因此某些每夜版支持的功能可能尚不可用。
问:内存不足 / 高显存占用
- 使用 精简版 INT8 扩散模型(19.5 GB),而不是 bf16
- 使用 NVFP4 AWQ 文本编码器(14.6 GB),它可以在任何 GPU 上运行
- 在分辨率选择器节点中降低分辨率(降低兆像素数)并缩短时长
- 在系统内存充足的机器上,ComfyUI 的动态显存系统和块交换功能会有所帮助
问:在 256p 或非常小的分辨率下生成失败
H3 的最低分辨率为 384p。256p 会完全失败。请使用官方模板中的分辨率预设。
问:输出视频没有音频
确保两个 VAE 均已加载:minimax_h3_video_vae_fp16.safetensors(视频)和 minimax_h3_audio_vae_fp32.safetensors(音频),并且工作流中包含连接到 SaveVideo 的 VAEDecodeAudio 节点。
问:图生视频应该使用哪个 checkpoint?
对于 T2V 和 I2V(首帧、末帧或两者),请使用 FL2VA checkpoint。当需要完整的基于参考的生成(身份、风格、声音)时,请使用 Ref2VA checkpoint。
问:在哪里可以反馈 bug?
- 运行时错误:ComfyUI/issues
- UI 问题:ComfyUI_frontend/issues
评论
使用 GitHub 登录后即可参与讨论。