MiniMax H3:开源全模态视频生成模型

ComfyUI Wiki

MiniMax H3 是一款开源全模态视频生成模型,原生支持 32 kHz 立体声音频、768p 输出和 2K 上下文内再生成。原生支持 ComfyUI。

M

MiniMax H3

视频生成原生音频全模态文生视频图生视频

MiniMax H3 是一款开源的通用全模态生成模型,能够同时理解文本、图像、视频和音频,并可一次性生成最长 15 秒、带原生 32 kHz 立体声音频的视频。它是 MiniMax Hailuo 视频系列的最新模型,由 33.1B 稠密单流全模态 Transformer 驱动,并配备 Qwen3-VL-32B 文本编码器。

开发者MiniMax
发布日期2026-08
架构33.1B 稠密单流全模态 Transformer(13B adaLN 分支)
文本编码器Qwen3-VL-32B(第 50 层隐藏状态)
视频 VAE时间因果 VAE,f16t4d24
音频 VAE32 kHz 立体声转 40 Hz Latent 标记
许可证MiniMax H3 社区许可证

MiniMax H3 能以 24 FPS 生成最长 15 秒的视频,并带有原生 32 kHz 立体声音频,支持 11 种语言。输出默认采用 768px 短边;H3-Regenerate-2K 模块可在上下文内以 2K 分辨率重新生成结果。该模型于 2026 年 8 月 3 日根据 MiniMax H3 社区许可协议正式开源,原生 ComfyUI 支持于同一天合并(Comfy-Org/ComfyUI #15224)。

模型

模型模式
FL2VA文生视频、首帧、尾帧、首尾帧
Ref2VA基于参考:最多 9 张图像、3 段视频、3 段音频片段(最多混合 12 个文件)

资源

Guides and workflows related to this model series.

No articles found.

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…