MiniMax H3:具备原生音频的开放全模态视频模型
MiniMax 推出 H3 全模态视频模型,可生成 2K 15 秒视频片段,自带原生立体声音频,支持多模态上下文理解和基于指令的编辑。
MiniMax 已正式发布 MiniMax H3,这是一款通用全模态生成模型,能够同时理解文本、图像、视频和音频。H3 可生成最高 2K 分辨率、时长 15 秒且自带原生立体声音频的视频,公司计划在未来数日内发布模型权重。
H3 是 MiniMax Hailuo 01/02 视频模型产品线的继任者。它是一款视频生成模型,而非 MiniMax 今年早些时候开源的 M 系列语言模型之一。
多模态上下文理解
真正的创意工作意味着跨模态融合信息。H3 可接受文本、图像、视频和音频的任意组合作为输入,并允许你用自然语言描述它们之间的关系。MiniMax 官方演示中的提示词示例为:“参考视频 1 中的希区柯克式运镜,让图像 2 中的角色唱歌,人声与音频 3 相匹配。” 模型自行完成全模态理解。
MiniMax 官方 H3 多模态上下文演示中使用的示例图像输入
H3 生成的视频,在单个提示词中结合了参考视频片段、图像和音轨(来源:MiniMax 博客)
核心能力
- 原生 2K 视频:单段视频最长 15 秒,分辨率达 2K,通过上下文内再生成实现,无需独立的超分辨率模块。
- 原生立体声音频:对白、音效和音乐与画面在同一轮生成中完成,语音、音效和音乐领域之间没有分离。
- 全参考生成:最多 9 张参考图像、3 段参考视频和 3 段参考音频可引导单次生成。
- 基于指令的编辑:通过自然语言描述修改内容,即可编辑现有图像、视频或音频。
- V2V 动作迁移:将源视频的动作迁移到新场景中。
- 强大的文字与品牌渲染:专为广告、品牌营销、电子商务、产品设计和 UI/UX 等用例打造。
原生立体声音频演示
原生立体声生成演示(来源:MiniMax 博客)
定价
MiniMax 将 H3 的性价比定位为行业领先:在 2K 分辨率下,每秒价格不到主流模型的三分之一;在 768p 分辨率下,价格不到竞争对手 720p 档位的一半。按量付费价格从 2K 输出每秒 0.13 美元起。
可用性
MiniMax H3 现已通过 MiniMax 平台 API 和 fal.ai 等第三方提供商开放使用。MiniMax 表示计划在未来数日内开放模型权重,具体须遵守适用法律法规;截至本文撰写时,尚未发布 Hugging Face 仓库,完整技术报告预计即将推出。
在 ComfyUI 中,H3 可通过官方 MiniMax 合作伙伴节点(基于 API)使用,该节点已于 7 月 31 日合并到 ComfyUI(Comfy-Org/ComfyUI #15167)。一旦开放权重发布,预计将提供原生本地支持。
评论
使用 GitHub 登录后即可参与讨论。