MiniMax Music 3:ComfyUI 安装与模型指南

ComfyUI Wiki

在 ComfyUI 中运行 MiniMax Music 3:官方 Comfy-Org 模型文件、FP16、FP32 与 INT8 DiT 变体、剪枝文本编码器、Flow-VAE 解码器,以及文本到音乐工作流。

M

MiniMax Music 3

音乐生成文本到音乐Flow Matching音频

MiniMax Music 3 是 MiniMax 推出的开放音乐生成模型,可生成长达五分钟的完整歌曲。它由 8B Global LLM 和 0.6B Local LLM 驱动 Flow Matching 合成器与 Flow-VAE 解码器,根据结构化描述与歌词生成 32 kHz 立体声 WAV 音频。该模型已在 ComfyUI 中官方支持。

开发者MiniMax
发布日期2026-09
架构Hybrid-LM(8B Global + 0.6B Local LLM)配合 Flow Matching 合成(2.4B)
音频输出32 kHz,16 位立体声 WAV
最大长度每首歌曲最长 5 分钟
许可证MiniMax Music 3 社区许可证

MiniMax Music 3 通过两类互补的输入生成完整歌曲:歌词(可包含 [Intro]、[Verse]、[Chorus]、[Bridge]、[Outro] 等段落标签)以及一段音乐描述,涵盖曲风、情绪、乐器编制、人声表现与制作风格。它能在长序列中保持音乐主题、节奏、人声特征与编曲的一致性,因此前奏、主歌、预副歌、副歌、桥段与尾奏等结构始终连贯。

工作原理

MiniMax Music 3 是一个分层自回归模型,将全局音乐结构与局部声学细节分离处理:

  • 8B Global LLM 基于 Qwen3-8B 初始化,逐帧预测第一个 RVQ codebook,并建模歌曲的长程结构。
  • 0.6B Local LLM 预测每一帧内剩余的声学 codebook,恢复细粒度细节。

合成模块并非仅从离散 token 解码,而是融合两个 LLM 的最终隐藏状态,将其送入 2.4B Flow-Matching 阶段生成 Flow-VAE latent,再由改编自 MiniMax Speech 的 123M Flow-VAE 解码器输出音频。训练所用的 tokenizer 使用八层 RVQ:一个包含 16,384 个条目的语义 codebook,外加七个各含 1,024 个条目的声学 codebook。

安装

MiniMax Music 3 通过官方 Comfy-Org 重新打包仓库在 ComfyUI 中提供原生支持。请将文件放入对应的文件夹:

文件目标位置
minimax_music3_dit_fp16.safetensors / minimax_music3_dit_fp32.safetensors / minimax_music3_dit_int8_convrot.safetensorsComfyUI/models/diffusion_models/
minimax_music3_text_encoder_bf16.safetensors / minimax_music3_text_encoder_pruned_bf16.safetensors / minimax_music3_text_encoder_pruned_int8_convrot.safetensorsComfyUI/models/text_encoders/
minimax_music3_dav.safetensorsComfyUI/models/vae/

DiT 提供 FP16(约 4.9 GB)、FP32 与 INT8 convrot 三种变体;文本编码器组合了 8B Global 与 0.6B Local LLM,并提供剪枝 BF16 和剪枝 INT8 convrot 选项,以减小占用体积。

资源

Guides and workflows related to this model series.

No articles found.

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…