MiniMax H3:带原生音频的开放全模态视频模型
ComfyUI Wiki
MiniMax H3 是一个开放的通用全模态生成模型:768p 视频 + 原生 32 kHz 立体声音频,支持 11 种语言和 2K 上下文内再生成。
M
MiniMax H3
视频生成原生音频全模态文生视频图生视频MiniMax H3 是一个开放的通用全模态生成系统,能够理解由文本、图像、视频和音频构成的多模态上下文,并在单次生成中输出最长 15 秒、带原生 32 kHz 立体声音频的视频。它是 MiniMax Hailuo 视频系列的最新模型,由 33.1B 稠密单流全模态 Transformer 驱动,并配备 Qwen3-VL-32B 文本编码器。
MiniMax 官方 H3 多模态上下文演示中的示例输入图片
MiniMax H3 于 2026 年 8 月 3 日根据 MiniMax H3 社区许可协议正式开源。本次开源涵盖 H3-Base 的两个任务专用 checkpoint:FL2VA(文生视频与首/尾帧条件生成)和 Ref2VA(基于参考的生成)。H3-Context-IR 预处理系统与 H3-Regenerate-2K 放大模块仍以托管 API 形式提供。
版本
| 版本 | 说明 |
|---|---|
| H3-Base FL2VA | 文生视频、首帧、尾帧、首尾帧模式 |
| H3-Base Ref2VA | 基于最多 9 张图像、3 段视频和 3 段音频片段的参考生成 |
主要能力
- 原生立体声音频:与画面同轮生成 32 kHz 立体声,无需单独的音频模型
- 多模态上下文:可输入文本、图像、视频和音频的任意组合
- 2K 上下文内再生成:H3-Regenerate-2K 复用原始上下文,将 768p 输出重新生成为 2K
- 11 种语言:ar、zh、en、fr、de、it、ja、ko、pt、ru、es
- 部署方式:SGLang、vLLM、diffusers 和 ComfyUI
安装
MiniMax H3 在 ComfyUI 中为原生支持。将文件放入对应目录:
| 文件 | 目标目录 |
|---|---|
minimax_h3_*_bf16.safetensors 或 *_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
qwen3vl_32b_minimax_h3_*.safetensors | ComfyUI/models/text_encoders/ |
minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ |
minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ |
官方 ComfyUI 重打包仓库(Comfy-Org/MiniMax-H3)提供 bf16、INT8 convrot 和 pruned INT8 扩散模型变体,以及 bf16、INT8 和 NVFP4 AWQ 文本编码器选项。得益于预计算的 adaLN 曲线表,pruned INT8 checkpoint 比标准 INT8 文件小约 40%,NVFP4 AWQ 文本编码器可在任意 GPU 上运行。
评论
使用 GitHub 登录后即可参与讨论。