ComfyUI 中的 MiniMax H3:完整视频生成指南

通过官方工作流掌握 ComfyUI 中的 MiniMax H3:T2V、I2V、R2V 模式,原生立体声音频,模型设置,分辨率指南,以及 AI 视频生成的故障排查。

MiniMax H3 是一个通用全模态生成模型,可以同时理解文本、图像、视频和音频,并生成带有原生立体声音频的视频(在单次前向传播中生成语音、音效和音乐)。它于 2026 年 8 月 3 日开源,当天即合并了 ComfyUI 的原生支持。

教程概述

本教程涵盖了在 ComfyUI 中运行 MiniMax H3 所需的全部内容:安装模型、加载官方工作流、了解三种生成模式(T2V、I2V、R2V)、选择合适的分辨率以及解决常见问题。

MiniMax H3 模型概述

MiniMax H3 是 MiniMax Hailuo 视频系列中的最新模型。它可生成最长 15 秒、24 FPS 的视频,支持原生 32 kHz 立体声音频,覆盖 11 种语言,最高分辨率可达 2K。该模型由 33.1B 密集单流全能变压器(omni transformer)驱动,并配备 Qwen3-VL-32B 文本编码器。

主要功能:

  • 原生立体声音频:对话、音效和音乐与视频一同生成,无需单独的音频模型
  • 全能模态上下文:支持文本、图像、视频和音频的任意组合作为输入
  • 三种任务模式:文生视频(T2V)、图生视频(I2V)和参考生视频(R2V)
  • 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语
  • 开放权重:MiniMax H3 社区许可证,完全本地推理

开放版本包含 H3-Base 的两个模型:FL2VA(文生视频及首尾帧条件)和 Ref2VA(基于参考的生成)。H3-Context-IR 预处理系统和 H3-Regenerate-2K 2K 图像放大模块仍为托管 API。

入门

ComfyUI 已支持开放权重的 MiniMax H3:

  1. 更新 ComfyUI 至最新版本(0.30.0 或更高版本;原生支持已合入 Comfy-Org/ComfyUI #15224
  2. 打开 工作流 -> 浏览模板 -> 视频,然后选择任意 MiniMax H3 工作流
  3. 按照弹窗提示下载模型并运行工作流

模型文件托管在 Hugging Face 的 Comfy-Org/MiniMax-H3 仓库中。

模型安装

Comfy-Org/MiniMax-H3 下载以下文件,并将它们放入对应的文件夹中:

Diffusion 模型(选择其中一个变体):

模型大小备注
minimax_h3_fl2va_pruned_int8_convrot.safetensors19.5 GB推荐:剪枝 INT8,体积缩小约 40%,T2V/I2V 的最佳平衡选择
minimax_h3_fl2va_int8_convrot.safetensors31.7 GB标准 INT8
minimax_h3_fl2va_bf16.safetensors61.7 GB全精度
minimax_h3_ref2va_pruned_int8_convrot.safetensors19.5 GB用于参考生视频(R2V)模式
minimax_h3_ref2va_bf16.safetensors61.7 GB全精度 R2V

文本编码器(选择其中一个):

模型大小备注
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors14.6 GB推荐:NVFP4 AWQ,可在任何 GPU 上运行
qwen3vl_32b_minimax_h3_int8_convrot.safetensors25.3 GBINT8 convrot
qwen3vl_32b_minimax_h3_bf16.safetensors48.0 GB全精度

VAE(两个均为必填):

模型大小
minimax_h3_video_vae_fp16.safetensors4.9 GB
minimax_h3_audio_vae_fp32.safetensors0.6 GB
📂 ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

官方工作流

通过 Comfy-Org/workflow_templates 提供了六个官方模板。其中三个在本地运行(开放权重),另外三个调用 MiniMax API。本指南将按照官方 Comfy-Org 文档,详细介绍这三个本地工作流。

加载工作流

方法 1:模板图库(推荐)

将 ComfyUI 更新到最新版本,然后通过 工作流 -> 浏览模板 -> 视频 -> MiniMax H3 加载。

方法 2:下载并拖入

下载 JSON 并将其拖入 ComfyUI 窗口。

设置输出分辨率

每个工作流都使用分辨率选择器节点,根据三个设置计算 widthheight

  • 纵横比:预设,例如 16:9(横屏)、9:16(竖屏)或 1:1(方形)
  • 百万像素:目标总像素数;数值越高,生成的画面越大,数值越低运行速度越快
  • 倍数:四舍五入到该数字的最近倍数;保持为 32 以匹配 H3 的分辨率网格

H3 的原生画布短边为 768px,上限为 768x1344 像素,并四舍五入到 32 的倍数。模板自带快速预览尺寸;如需全质量,请在 16:9 下将百万像素提高到约 1.0,即可获得约 1344x768 的分辨率。

1. MiniMax H3 文生视频(T2V)

根据文本提示生成视频,并带有原生立体声音频。

模型下载(T2V)

组件文件目标位置
Diffusion 模型minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
文本编码器qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

模型存储(T2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

提示词技巧(T2V)

  • 描述整个场景:先说明整体场景(地点、角色、正在发生的事情),再将其拆分为按时间划分的镜头
  • 镜头、相机和音频:在同一个提示词区块中描述镜头、相机运动以及伴随的音频(对白、音效、音乐)
  • 时长:时长输入会吸附到模型在 24 FPS 下的 17 帧/块(17k+5)网格上
  • 首帧/末帧:将图像连接到 MiniMaxH3ImageToVideo 节点上的 first_frame 和/或 last_frame,即可将该工作流转换为首帧/末帧图生视频

2. MiniMax H3 图生视频(I2V)

从输入图像生成视频,并可选择使用首帧/末帧关键帧。

输入图像: Input Image - 下载默认输入图像,或使用您自己的图像。

模型下载(I2V)

组件文件目标位置
Diffusion 模型minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
文本编码器qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

模型存储(I2V)

布局与 T2V 工作流相同(FL2VA Diffusion 模型 + NVFP4 文本编码器 + 两个 VAE)。

提示词技巧(I2V)

  • 关键帧first_framelast_frame 输入为可选项;模型生成它们之间的运动
  • 提示词:在同一个提示块中描述镜头、运动以及伴随的音频(对话、音效、音乐)
  • 时长:在 24 FPS 下对齐到每块 17 帧(17k+5)的网格

3. MiniMax H3 参考生视频 (R2V)

根据参考图像、视频和音频的任意组合,生成可锁定角色、风格、运动、相机运动或声音的视频。

参考图像:

  • Reference Image - 工作流的角色参考图,或使用您自己的图像
  • Reference Image - 工作流的风格和主体参考图,或使用您自己的图像

模型下载 (R2V)

组件文件目标位置
扩散模型minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/
文本编码器qwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/
VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/
VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/

模型存储 (R2V)

ComfyUI/
├── 📂 models/
│   ├── 📂 diffusion_models/
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│   ├── 📂 text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── 📂 vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

提示词技巧 (R2V)

  • 按标签引用参考:按照连接时的确切顺序,通过标签引用每个输入,例如 <Picture 1><Video 1><Audio 1>
  • 为每个参考分配任务:明确说明哪个参考驱动镜头的哪个部分(身份、风格、运动、相机、声音);明确的分配效果要好得多
  • 限制:最多 9 张参考图像、3 段参考视频(每段可自带音轨)和 3 段独立的参考音频片段
  • ref_image_sizematch 会将参考图缩小到生成分辨率以提升速度;max 保留最长 2048 像素的短边,以获得更强的身份保真度,但会牺牲速度
  • 采样器:对于参考内容较多的提示词,res_multistep 搭配 betanormal 调度器往往优于 simple
  • 注意:R2V 使用 ref2va 扩散模型,与 T2V 和 I2V 使用的 fl2va 模型权重不同

API 工作流

另外三个官方模板调用 MiniMax API,而不是在本地运行:

模板模式
api_minimax_h3_t2v.jsonAPI:文本转视频
api_minimax_h3_r2v.jsonAPI:参考转视频
api_minimax_h3_flf2v.jsonAPI:首帧/尾帧转视频

故障排查

问:ComfyUI 不显示 MiniMax H3 节点

将 ComfyUI 更新到 0.30.0 或更高版本。原生支持已于 2026 年 8 月 3 日合入 Comfy-Org/ComfyUI #15224。桌面端和云端更新会跟随稳定版发布,因此某些每夜版支持的功能可能尚不可用。

问:内存不足 / 高显存占用

  • 使用 精简版 INT8 扩散模型(19.5 GB),而不是 bf16
  • 使用 NVFP4 AWQ 文本编码器(14.6 GB),它可以在任何 GPU 上运行
  • 在分辨率选择器节点中降低分辨率(降低兆像素数)并缩短时长
  • 在系统内存充足的机器上,ComfyUI 的动态显存系统和块交换功能会有所帮助

问:在 256p 或非常小的分辨率下生成失败

H3 的最低分辨率为 384p。256p 会完全失败。请使用官方模板中的分辨率预设。

问:输出视频没有音频

确保两个 VAE 均已加载:minimax_h3_video_vae_fp16.safetensors(视频)和 minimax_h3_audio_vae_fp32.safetensors(音频),并且工作流中包含连接到 SaveVideoVAEDecodeAudio 节点。

问:图生视频应该使用哪个 checkpoint?

对于 T2V 和 I2V(首帧、末帧或两者),请使用 FL2VA checkpoint。当需要完整的基于参考的生成(身份、风格、声音)时,请使用 Ref2VA checkpoint。

问:在哪里可以反馈 bug?

相关资源

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…