ComfyUI 中的 MiniMax H3:完整视频生成指南

在 ComfyUI 中下载并运行 MiniMax H3:T2V、I2V 和 R2V 工作流,官方模型与 VAE 文件,GGUF/INT8/NVFP4 量化选项,性能优化技巧与故障排查。

MiniMax H3 是一个通用全模态生成模型,可以同时理解文本、图像、视频和音频,并生成带有原生立体声音频的视频(在单次前向传播中生成语音、音效和音乐)。它于 2026 年 8 月 3 日开源,当天即合并了 ComfyUI 的原生支持。

教程概述

本教程涵盖了在 ComfyUI 中运行 MiniMax H3 所需的全部内容:安装模型、加载官方工作流、了解三种生成模式(T2V、I2V、R2V)、选择合适的分辨率以及解决常见问题。

MiniMax H3 模型概述

MiniMax H3 是 MiniMax Hailuo 视频系列中的最新模型。它可生成最长 15 秒、24 FPS 的视频,支持原生 32 kHz 立体声音频,覆盖 11 种语言,最高分辨率可达 2K。该模型由 33.1B 密集单流全能变压器(omni transformer)驱动,并配备 Qwen3-VL-32B 文本编码器。

主要功能:

  • 原生立体声音频:对话、音效和音乐与视频一同生成,无需单独的音频模型
  • 全能模态上下文:支持文本、图像、视频和音频的任意组合作为输入
  • 三种任务模式:文生视频(T2V)、图生视频(I2V)和参考生视频(R2V)
  • 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语
  • 开放权重:MiniMax H3 社区许可证,完全本地推理

开放版本包含 H3-Base 的两个模型:FL2VA(文生视频及首尾帧条件)和 Ref2VA(基于参考的生成)。H3-Context-IR 预处理系统和 H3-Regenerate-2K 2K 图像放大模块仍为托管 API。

入门

ComfyUI 已支持开放权重的 MiniMax H3:

  1. 更新 ComfyUI 至最新版本(0.30.0 或更高版本;原生支持已合入 Comfy-Org/ComfyUI #15224
  2. 打开 工作流 -> 浏览模板 -> 视频,然后选择任意 MiniMax H3 工作流
  3. 按照弹窗提示下载模型并运行工作流

模型文件托管在 Hugging Face 的 Comfy-Org/MiniMax-H3 仓库中。

模型安装

Comfy-Org/MiniMax-H3 下载以下文件,并将它们放入对应的文件夹中:

Diffusion 模型(选择其中一个变体):

模型大小备注
minimax_h3_fl2va_pruned_int8_convrot.safetensors19.5 GB推荐:剪枝 INT8,体积缩小约 40%,T2V/I2V 的最佳平衡选择
minimax_h3_fl2va_int8_convrot.safetensors31.7 GB标准 INT8
minimax_h3_fl2va_bf16.safetensors61.7 GB全精度
minimax_h3_ref2va_pruned_int8_convrot.safetensors19.5 GB用于参考生视频(R2V)模式
minimax_h3_ref2va_bf16.safetensors61.7 GB全精度 R2V

文本编码器(选择其中一个):

模型大小备注
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors14.6 GB推荐:NVFP4 AWQ,可在任何 GPU 上运行
qwen3vl_32b_minimax_h3_int8_convrot.safetensors25.3 GBINT8 convrot
qwen3vl_32b_minimax_h3_bf16.safetensors48.0 GB全精度

VAE(两个均为必填):

模型大小
minimax_h3_video_vae_fp16.safetensors4.9 GB
minimax_h3_audio_vae_fp32.safetensors0.6 GB
📂 ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

官方工作流

通过 Comfy-Org/workflow_templates 提供了六个官方模板。其中三个在本地运行(开放权重),另外三个调用 MiniMax API。本指南将按照官方 Comfy-Org 文档,详细介绍这三个本地工作流。

加载工作流

方法 1:模板图库(推荐)

将 ComfyUI 更新到最新版本,然后通过 工作流 -> 浏览模板 -> 视频 -> MiniMax H3 加载。

方法 2:下载并拖入

下载 JSON 并将其拖入 ComfyUI 窗口。

设置输出分辨率

每个工作流都使用分辨率选择器节点,根据三个设置计算 widthheight

  • 纵横比:预设,例如 16:9(横屏)、9:16(竖屏)或 1:1(方形)
  • 百万像素:目标总像素数;数值越高,生成的画面越大,数值越低运行速度越快
  • 倍数:四舍五入到该数字的最近倍数;保持为 32 以匹配 H3 的分辨率网格

H3 的原生画布短边为 768px,上限为 768x1344 像素,并四舍五入到 32 的倍数。模板自带快速预览尺寸;如需全质量,请在 16:9 下将百万像素提高到约 1.0,即可获得约 1344x768 的分辨率。

1. MiniMax H3 文生视频(T2V)

根据文本提示生成视频,并带有原生立体声音频。

模型下载(T2V)

组件文件目标位置
Diffusion 模型minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
文本编码器qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

模型存储(T2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

提示词技巧(T2V)

  • 描述整个场景:先说明整体场景(地点、角色、正在发生的事情),再将其拆分为按时间划分的镜头
  • 镜头、相机和音频:在同一个提示词区块中描述镜头、相机运动以及伴随的音频(对白、音效、音乐)
  • 时长:时长输入会吸附到模型在 24 FPS 下的 17 帧/块(17k+5)网格上
  • 首帧/末帧:将图像连接到 MiniMaxH3ImageToVideo 节点上的 first_frame 和/或 last_frame,即可将该工作流转换为首帧/末帧图生视频

2. MiniMax H3 图生视频(I2V)

从输入图像生成视频,并可选择使用首帧/末帧关键帧。

输入图像: Input Image - 下载默认输入图像,或使用您自己的图像。

模型下载(I2V)

组件文件目标位置
Diffusion 模型minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
文本编码器qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

模型存储(I2V)

布局与 T2V 工作流相同(FL2VA Diffusion 模型 + NVFP4 文本编码器 + 两个 VAE)。

提示词技巧(I2V)

  • 关键帧first_framelast_frame 输入为可选项;模型生成它们之间的运动
  • 提示词:在同一个提示块中描述镜头、运动以及伴随的音频(对话、音效、音乐)
  • 时长:在 24 FPS 下对齐到每块 17 帧(17k+5)的网格

3. MiniMax H3 参考生视频 (R2V)

根据参考图像、视频和音频的任意组合,生成可锁定角色、风格、运动、相机运动或声音的视频。

参考图像:

  • Reference Image - 工作流的角色参考图,或使用您自己的图像
  • Reference Image - 工作流的风格和主体参考图,或使用您自己的图像

模型下载 (R2V)

组件文件目标位置
扩散模型minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
文本编码器qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

模型存储 (R2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

提示词技巧 (R2V)

  • 按标签引用参考:按照连接时的确切顺序,通过标签引用每个输入,例如 <Picture 1><Video 1><Audio 1>
  • 为每个参考分配任务:明确说明哪个参考驱动镜头的哪个部分(身份、风格、运动、相机、声音);明确的分配效果要好得多
  • 限制:最多 9 张参考图像、3 段参考视频(每段可自带音轨)和 3 段独立的参考音频片段
  • ref_image_sizematch 会将参考图缩小到生成分辨率以提升速度;max 保留最长 2048 像素的短边,以获得更强的身份保真度,但会牺牲速度
  • 采样器:对于参考内容较多的提示词,res_multistep 搭配 betanormal 调度器往往优于 simple
  • 注意:R2V 使用 ref2va 扩散模型,与 T2V 和 I2V 使用的 fl2va 模型权重不同

API 工作流

另外三个官方模板调用 MiniMax API,而不是在本地运行:

模板模式
api_minimax_h3_t2v.jsonAPI:文本转视频
api_minimax_h3_r2v.jsonAPI:参考转视频
api_minimax_h3_flf2v.jsonAPI:首帧/尾帧转视频

故障排查

不要安装 ComfyUI-MiniMaxH3-Cache 该自定义节点会全局 monkey-patch MiniMax H3 模型代码,可能在 ComfyUI 更新后破坏 H3 生成(甚至破坏 ComfyUI 本身),即使从未使用过它。参见 lihaoyun6/ComfyUI-MiniMaxH3-Cache#4。如果已经安装,请从 custom_nodes/ 中删除并重启 ComfyUI。

问:ComfyUI 不显示 MiniMax H3 节点

将 ComfyUI 更新到 0.30.0 或更高版本。原生支持已于 2026 年 8 月 3 日合入 Comfy-Org/ComfyUI #15224。桌面端和云端更新会跟随稳定版发布,因此某些每夜版支持的功能可能尚不可用。

问:内存不足 / 高显存占用

  • 使用 精简版 INT8 扩散模型(19.5 GB),而不是 bf16
  • 使用 NVFP4 AWQ 文本编码器(14.6 GB),它可以在任何 GPU 上运行
  • 在分辨率选择器节点中降低分辨率(降低兆像素数)并缩短时长
  • 在系统内存充足的机器上,ComfyUI 的动态显存系统和块交换功能会有所帮助

问:在 256p 或非常小的分辨率下生成失败

H3 的最低分辨率为 384p。256p 会完全失败。请使用官方模板中的分辨率预设。

问:输出视频没有音频

确保两个 VAE 均已加载:minimax_h3_video_vae_fp16.safetensors(视频)和 minimax_h3_audio_vae_fp32.safetensors(音频),并且工作流中包含连接到 SaveVideoVAEDecodeAudio 节点。

问:图生视频应该使用哪个 checkpoint?

对于 T2V 和 I2V(首帧、末帧或两者),请使用 FL2VA checkpoint。当需要完整的基于参考的生成(身份、风格、声音)时,请使用 Ref2VA checkpoint。

问:在哪里可以反馈 bug?

MiniMax H3 性能优化提示

社区测试过的官方工作流加速设置:

  • 采样器与调度器res_multistep 搭配 simple 调度器、20 步是 T2V 和 I2V 的常用基线。降低步数可以节省时间,但低于约 15 步时画质会明显下降。提高到 25 步时,画面内容和动态会略好一些,但生成时间更长。
  • Sage 注意力:使用 --use-sage-attention 启动 ComfyUI(内置功能,无需自定义节点)。社区报告在中端 GPU 上生成速度可提升约 2 倍,但分辨率越高收益越小;结果因 GPU 而异。
  • 分辨率:快速出片时可将分辨率选择器保持在 0.4 MP 左右(例如 768x512)。H3 在其 384p 最低分辨率下即可用,这远低于以往视频模型的要求。
  • 固定内存:在 ComfyUI 0.30.x 上,固定内存回归可能导致模型加载非常慢。据报道,使用 --disable-pinned-memory 启动可恢复快速加载,并在某些配置下显著缩短生成时间。

MiniMax H3 社区量化模型

可在原生 ComfyUI 中加载的 MiniMax H3 扩散模型社区量化版本。它们是第三方转换,并非 MiniMax 或 Comfy-Org 官方发布;请查看各仓库的 README 了解许可证和质量说明。

INT8

模型说明
DmitryDB/MiniMax-H3-INT8-Lean-ConvRot面向质量的 INT8 Lean ConvRot,FL2VA 和 Ref2VA 各约 20.9 GiB,专为 24 GB GPU 首选设计
Gluttony10/MiniMax-H3-INT8-CONVROTINT8 convrot 的 FL2VA 和 Ref2VA,附带音频/视频 VAE 和 INT8 Qwen3-VL 文本编码器

INT4

模型说明
Merserk/MiniMax-H3-INT4-ConvRot精简版 FL2VA 和 Ref2VA 各 11.3 GB,外加 INT4 文本编码器,面向 12 GB GPU
tsolful/Minimax_H3_INT4MixedConvRot混合精度 INT4 FL2VA,提供均衡(INT4BQ)和高画质(INT4Q)变体

NVFP4

模型说明
rockerBOO/minimax-h3-nvfp4FL2VA 的 NVFP4 和精简版 INT4 convrot 变体
lilcheaty/MiniMax-H3-NVFP4NVFP4 的 FL2VA 和 Ref2VA 变体,包含混合精度 checkpoint
ModelsLab/MiniMax-H3-ref2va-NVFP4用于参考工作流的 Ref2VA NVFP4 checkpoint

FP8

模型说明
rzgar/minimax_h3_fl2va_fp8_e4m3fnFP8 E4M3FN FL2VA;作者报告使用 dpmpp_2m / sgm_uniform 时 8 步为最佳平衡点

相关资源

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…