MiniMax H3:开源全模态视频生成模型
ComfyUI Wiki
MiniMax H3 是一款开源全模态视频生成模型,原生支持 32 kHz 立体声音频、768p 输出和 2K 上下文内再生成。原生支持 ComfyUI。
M
MiniMax H3
视频生成原生音频全模态文生视频图生视频MiniMax H3 是一款开源的通用全模态生成模型,能够同时理解文本、图像、视频和音频,并可一次性生成最长 15 秒、带原生 32 kHz 立体声音频的视频。它是 MiniMax Hailuo 视频系列的最新模型,由 33.1B 稠密单流全模态 Transformer 驱动,并配备 Qwen3-VL-32B 文本编码器。
| 开发者 | MiniMax |
| 发布日期 | 2026-08 |
| 架构 | 33.1B 稠密单流全模态 Transformer(13B adaLN 分支) |
| 文本编码器 | Qwen3-VL-32B(第 50 层隐藏状态) |
| 视频 VAE | 时间因果 VAE,f16t4d24 |
| 音频 VAE | 32 kHz 立体声转 40 Hz Latent 标记 |
| 许可证 | MiniMax H3 社区许可证 |
MiniMax H3 能以 24 FPS 生成最长 15 秒的视频,并带有原生 32 kHz 立体声音频,支持 11 种语言。输出默认采用 768px 短边;H3-Regenerate-2K 模块可在上下文内以 2K 分辨率重新生成结果。该模型于 2026 年 8 月 3 日根据 MiniMax H3 社区许可协议正式开源,原生 ComfyUI 支持于同一天合并(Comfy-Org/ComfyUI #15224)。
模型
| 模型 | 模式 |
|---|---|
| FL2VA | 文生视频、首帧、尾帧、首尾帧 |
| Ref2VA | 基于参考:最多 9 张图像、3 段视频、3 段音频片段(最多混合 12 个文件) |
资源
Guides and workflows related to this model series.
No articles found.
评论
使用 GitHub 登录后即可参与讨论。