MiniMax H3 开放权重正式发布,原生 ComfyUI 支持已合并

ComfyUI Wikinews

MiniMax H3 开放权重已上线 Hugging Face,原生 ComfyUI 支持已合并。提供 bf16、INT8、pruned、NVFP4 重打包文件,并随发布附带六个官方工作流模板。

MiniMax 的 H3 全模态视频模型(Hailuo 系列背后的模型)开放权重现已正式发布。权重已上线 Hugging Face,原生 ComfyUI 支持也在同一天落地:pull request Comfy-Org/ComfyUI #15224 于 8 月 3 日合并,新增四个节点和六个官方工作流模板,实现音视频联合生成。

H3 于 7 月 31 日发布(阅读发布报道)。开放权重发布把这个 33.1B 参数的音视频联合扩散 Transformer 带到本地 GPU,并提供多种量化选项。

H3 官方演示中的示例输入图片

MiniMax 官方 H3 多模态上下文演示中的示例输入图片

H3 在单个提示中结合参考片段、图片和音轨生成的视频(来源:MiniMax 博客)

系统概览

H3 是一个通用型全模态生成系统,由三个模块组成:

  • H3-Context-IR:托管式预处理与编排系统,解析多模态上下文(文本、图像、视频、音频)并转换为结构化中间表示供生成使用。该模块不在开源范围内;MiniMax 以 API 形式提供,并发布提示词写作指南供自行搭建。
  • H3-Base:开源的 33.1B 全模态 Transformer,生成带原生立体声音频的 768p 视频。
  • H3-Regenerate-2K:以 in-context 方式将 768p 输出重新生成为 2K 分辨率,复用原始多模态上下文。该模块尚未开源;API 可复现完整 2K 流程。

本次开源涵盖 H3-Base 的两个任务专用 checkpoint:FL2VA(文生视频、首帧、尾帧、首尾帧模式)和 Ref2VA(基于参考图像、视频和音频的参考生成)。

输出规格

项目规格
时长4-15 秒
宽高比21:9、16:9、4:3、1:1、3:4、9:16
分辨率默认短边 768px;2K 通过 H3-Regenerate-2K
帧率24 FPS
音频32 kHz 立体声,同一轮生成
语言稳定支持 11 种(ar、zh、en、fr、de、it、ja、ko、pt、ru、es)

输入模式

FL2VA 接受 0、1 或 2 张图像:无图像为文生视频,一张图像为首帧或尾帧条件,两张图像为首尾帧条件。

Ref2VA 接受最多 9 张参考图像、3 段参考视频(每段 2-15 秒,总时长不超过 15 秒)和 3 段参考音频(每段 2-15 秒,总时长不超过 15 秒,必须与图像或视频一同输入)。混合输入合计最多 12 个文件。

开放权重已上线 Hugging Face

两个仓库现已上线:

  • MiniMaxAI/MiniMax-H3Hugging Face):官方发布的 Diffusers 格式,包含 FL2VA 与 Ref2VA 变体、完整模型代码和提示词写作指南(基础版 / 参考版),采用 MiniMax H3 社区许可协议。
  • Comfy-Org/MiniMax-H3Hugging Face):为 ComfyUI 原生节点重打包的文件,可直接放入 models/diffusion_modelsmodels/text_encodersmodels/vae
组件文件
扩散模型minimax_h3_fl2va_bf16(61.7 GB)、minimax_h3_fl2va_int8_convrot(31.7 GB)、minimax_h3_fl2va_pruned_int8_convrot(19.5 GB),以及对应的 ref2va_* 变体
文本编码器qwen3vl_32b_minimax_h3_bf16(48.0 GB)、int8_convrot(25.3 GB)、nvfp4_awq(14.6 GB)
VAEminimax_h3_video_vae_fp16(4.9 GB)、minimax_h3_audio_vae_fp32(0.6 GB)

得益于预计算的 adaLN 曲线表,pruned INT8 checkpoint 比标准 INT8 文件小约 40%,NVFP4 AWQ 文本编码器可在任意 GPU 上运行。

原生 ComfyUI 支持已合并

原生支持已于 8 月 3 日以 Comfy-Org/ComfyUI #15224 合并,集成了单流打包式扩散 Transformer,联合去噪视频与立体声音频 latent,条件控制基于 Qwen3-VL-32B 的隐藏状态并携带逐 token 模态标签。四个新节点负责工作流:EmptyMiniMaxH3LatentAVMiniMaxH3ImageToVideoMiniMaxH3ReferenceToVideoMiniMaxH3SigmaShift

官方文生视频与图生视频工作流可下载使用:

官方工作流模板

六个官方模板已通过 Comfy-Org/workflow_templates 发布:

模板模式
video_minimax_h3_t2v.json本地:文生视频
video_minimax_h3_i2v.json本地:图生视频
video_minimax_h3_r2v.json本地:参考转视频
api_minimax_h3_t2v.jsonAPI:文生视频
api_minimax_h3_r2v.jsonAPI:参考转视频
api_minimax_h3_flf2v.jsonAPI:首/末帧转视频

本地开放权重工作流的分步教程已发布在官方文档:MiniMax H3 开源工作流教程

可用性

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 开放权重正式发布,原生 ComfyUI 支持已合并 | ComfyUI Wiki