MiniMax Music 3:ComfyUI 安装与模型指南
在 ComfyUI 中运行 MiniMax Music 3:官方 Comfy-Org 模型文件、FP16、FP32 与 INT8 DiT 变体、剪枝文本编码器、Flow-VAE 解码器,以及文本到音乐工作流。
MiniMax Music 3
音乐生成文本到音乐Flow Matching音频MiniMax Music 3 是 MiniMax 推出的开放音乐生成模型,可生成长达五分钟的完整歌曲。它由 8B Global LLM 和 0.6B Local LLM 驱动 Flow Matching 合成器与 Flow-VAE 解码器,根据结构化描述与歌词生成 32 kHz 立体声 WAV 音频。该模型已在 ComfyUI 中官方支持。
| 开发者 | MiniMax |
| 发布日期 | 2026-09 |
| 架构 | Hybrid-LM(8B Global + 0.6B Local LLM)配合 Flow Matching 合成(2.4B) |
| 音频输出 | 32 kHz,16 位立体声 WAV |
| 最大长度 | 每首歌曲最长 5 分钟 |
| 许可证 | MiniMax Music 3 社区许可证 |
MiniMax Music 3 通过两类互补的输入生成完整歌曲:歌词(可包含 [Intro]、[Verse]、[Chorus]、[Bridge]、[Outro] 等段落标签)以及一段音乐描述,涵盖曲风、情绪、乐器编制、人声表现与制作风格。它能在长序列中保持音乐主题、节奏、人声特征与编曲的一致性,因此前奏、主歌、预副歌、副歌、桥段与尾奏等结构始终连贯。
工作原理
MiniMax Music 3 是一个分层自回归模型,将全局音乐结构与局部声学细节分离处理:
- 8B Global LLM 基于 Qwen3-8B 初始化,逐帧预测第一个 RVQ codebook,并建模歌曲的长程结构。
- 0.6B Local LLM 预测每一帧内剩余的声学 codebook,恢复细粒度细节。
合成模块并非仅从离散 token 解码,而是融合两个 LLM 的最终隐藏状态,将其送入 2.4B Flow-Matching 阶段生成 Flow-VAE latent,再由改编自 MiniMax Speech 的 123M Flow-VAE 解码器输出音频。训练所用的 tokenizer 使用八层 RVQ:一个包含 16,384 个条目的语义 codebook,外加七个各含 1,024 个条目的声学 codebook。
安装
MiniMax Music 3 通过官方 Comfy-Org 重新打包仓库在 ComfyUI 中提供原生支持。请将文件放入对应的文件夹:
| 文件 | 目标位置 |
|---|---|
minimax_music3_dit_fp16.safetensors / minimax_music3_dit_fp32.safetensors / minimax_music3_dit_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
minimax_music3_text_encoder_bf16.safetensors / minimax_music3_text_encoder_pruned_bf16.safetensors / minimax_music3_text_encoder_pruned_int8_convrot.safetensors | ComfyUI/models/text_encoders/ |
minimax_music3_dav.safetensors | ComfyUI/models/vae/ |
DiT 提供 FP16(约 4.9 GB)、FP32 与 INT8 convrot 三种变体;文本编码器组合了 8B Global 与 0.6B Local LLM,并提供剪枝 BF16 和剪枝 INT8 convrot 选项,以减小占用体积。
资源
Guides and workflows related to this model series.
评论
使用 GitHub 登录后即可参与讨论。