MiniMax Music 3:支持 ComfyUI 的开源音乐生成模型
MiniMax 发布 Music 3,这是一款开源音乐生成模型,可根据结构化描述和歌词创作最长 5 分钟的完整歌曲,具有富有表现力的人声,并原生支持 ComfyUI。
概述
MiniMax Music 3 是 MiniMax 推出的开源音乐生成模型,随官方演示页面一同发布。该模型可生成结构连贯的歌曲,具有富有表现力的人声、不断演进的编曲和稳定的长音频质量,输出 32 kHz 16 位立体声 WAV 音频。
MiniMax Music 3 官方横幅
该模型采用分层自回归(Hybrid-LM)架构,将全局音乐建模与局部声学建模相分离:
- **全局 LLM(8B)**逐帧预测第一个 RVQ 码本,并对歌曲的长期语义和结构演进进行建模。它基于 Qwen3-8B 初始化。
- **局部 LLM(0.6B)**预测每个帧内的剩余声学码本,并恢复细粒度的声学细节。
- 基于 Flow Matching(2.4B) 和 Flow-VAE 解码器(123M)的连续隐藏状态合成系统,将融合后的隐藏状态转换为波形音频,保留人声咬字和乐器质感。
MiniMax Music 3 架构:Hybrid-LM 与 Flow Matching 和 Flow-VAE 合成
主要特性
最长 5 分钟的完整歌曲。 该模型原生支持包含前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等结构的完整歌曲生成,并在长序列中保持音乐主题、节奏、人声特征和编曲推进。
双输入控制。 MiniMax Music 3 接受两种互补的输入:
- 歌词定义演唱的文本内容,可包含明确的段落标签,例如
[Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Bridge]、[Instrumental]、[Solo]和[Outro]。 - 音乐描述定义音乐风格、情感走向、人声表现、配器、编曲和制作特征。包含三个部分(全局元数据、人声详情和编曲)的结构化描述,让模型能够对歌曲随时间的音乐发展进行精确、细粒度的控制。
富有表现力的人声。 自然的人声合成,可控制旋律、发音和分层和声。
音乐 tokenizer。 训练使用八层残差向量量化(RVQ):一个包含 16,384 个条目的语义码本,外加七个各包含 1,024 个条目的声学码本。
ComfyUI 支持
ComfyUI 原生支持 MiniMax Music 3,并提供官方示例工作流 MiniMax Music 3 Text to Music,可从模板库(Audio 类别)或官方 ComfyUI 教程中获取。
官方 MiniMax Music 3 Text to Music 工作流模板
ComfyUI 适配的模型文件(重新打包的 diffusion model、文本编码器和 VAE)托管在 Comfy-Org/MiniMax-Music-3 仓库中,原始权重位于 MiniMaxAI/MiniMax-Music3。
权重与变体
| 文件 | 文件夹 | 大小 |
|---|---|---|
minimax_music3_dit_fp16.safetensors | diffusion_models | 4.9 GB |
minimax_music3_dit_fp32.safetensors | diffusion_models | 9.8 GB |
minimax_music3_dit_int8_convrot.safetensors | diffusion_models | 2.5 GB |
minimax_music3_text_encoder_bf16.safetensors | text_encoders | 18.5 GB |
minimax_music3_text_encoder_pruned_bf16.safetensors | text_encoders | 16.7 GB |
minimax_music3_text_encoder_pruned_int8_convrot.safetensors | text_encoders | 9.2 GB |
minimax_music3_dav.safetensors | vae | 217 MB |
全精度模型可在 24 GB 及以下的显存上运行;启用自动 CPU 卸载后,生成约需 22 GB,而逐层流式加载语言模型甚至可在 8 GB 显卡上运行。
可用性
该模型支持通过 SGLang-Omni 进行服务部署,并提供模块化的 diffusers pipeline。在 ComfyUI 中,更新到最新版本,打开模板库,选择 MiniMax Music 3 Text to Music 工作流,系统会提示您下载所需的模型文件。
评论
使用 GitHub 登录后即可参与讨论。