MiniMax Music 3:支持 ComfyUI 的开源音乐生成模型

ComfyUI Wikinews

MiniMax 发布 Music 3,这是一款开源音乐生成模型,可根据结构化描述和歌词创作最长 5 分钟的完整歌曲,具有富有表现力的人声,并原生支持 ComfyUI。

MiniMax 已发布 Music 3,这是一款开源音乐生成模型,可根据歌词和结构化音乐描述创作长达 五分钟 的完整歌曲。ComfyUI 原生支持该模型,并提供官方示例工作流,ComfyUI 适配权重可在 Hugging Face 上获取。

概述

MiniMax Music 3 是 MiniMax 推出的开源音乐生成模型,随官方演示页面一同发布。该模型可生成结构连贯的歌曲,具有富有表现力的人声、不断演进的编曲和稳定的长音频质量,输出 32 kHz 16 位立体声 WAV 音频。

MiniMax Music 3 横幅

MiniMax Music 3 官方横幅

该模型采用分层自回归(Hybrid-LM)架构,将全局音乐建模与局部声学建模相分离:

  • **全局 LLM(8B)**逐帧预测第一个 RVQ 码本,并对歌曲的长期语义和结构演进进行建模。它基于 Qwen3-8B 初始化。
  • **局部 LLM(0.6B)**预测每个帧内的剩余声学码本,并恢复细粒度的声学细节。
  • 基于 Flow Matching(2.4B)Flow-VAE 解码器(123M)的连续隐藏状态合成系统,将融合后的隐藏状态转换为波形音频,保留人声咬字和乐器质感。
MiniMax Music 3 架构

MiniMax Music 3 架构:Hybrid-LM 与 Flow Matching 和 Flow-VAE 合成

主要特性

最长 5 分钟的完整歌曲。 该模型原生支持包含前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等结构的完整歌曲生成,并在长序列中保持音乐主题、节奏、人声特征和编曲推进。

双输入控制。 MiniMax Music 3 接受两种互补的输入:

  • 歌词定义演唱的文本内容,可包含明确的段落标签,例如 [Intro][Verse][Pre-Chorus][Chorus][Bridge][Instrumental][Solo][Outro]
  • 音乐描述定义音乐风格、情感走向、人声表现、配器、编曲和制作特征。包含三个部分(全局元数据、人声详情和编曲)的结构化描述,让模型能够对歌曲随时间的音乐发展进行精确、细粒度的控制。

富有表现力的人声。 自然的人声合成,可控制旋律、发音和分层和声。

音乐 tokenizer。 训练使用八层残差向量量化(RVQ):一个包含 16,384 个条目的语义码本,外加七个各包含 1,024 个条目的声学码本。

ComfyUI 支持

ComfyUI 原生支持 MiniMax Music 3,并提供官方示例工作流 MiniMax Music 3 Text to Music,可从模板库(Audio 类别)或官方 ComfyUI 教程中获取。

MiniMax Music 3 ComfyUI 工作流

官方 MiniMax Music 3 Text to Music 工作流模板

ComfyUI 适配的模型文件(重新打包的 diffusion model、文本编码器和 VAE)托管在 Comfy-Org/MiniMax-Music-3 仓库中,原始权重位于 MiniMaxAI/MiniMax-Music3

权重与变体

文件文件夹大小
minimax_music3_dit_fp16.safetensorsdiffusion_models4.9 GB
minimax_music3_dit_fp32.safetensorsdiffusion_models9.8 GB
minimax_music3_dit_int8_convrot.safetensorsdiffusion_models2.5 GB
minimax_music3_text_encoder_bf16.safetensorstext_encoders18.5 GB
minimax_music3_text_encoder_pruned_bf16.safetensorstext_encoders16.7 GB
minimax_music3_text_encoder_pruned_int8_convrot.safetensorstext_encoders9.2 GB
minimax_music3_dav.safetensorsvae217 MB

全精度模型可在 24 GB 及以下的显存上运行;启用自动 CPU 卸载后,生成约需 22 GB,而逐层流式加载语言模型甚至可在 8 GB 显卡上运行。

可用性

该模型支持通过 SGLang-Omni 进行服务部署,并提供模块化的 diffusers pipeline。在 ComfyUI 中,更新到最新版本,打开模板库,选择 MiniMax Music 3 Text to Music 工作流,系统会提示您下载所需的模型文件。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax Music 3:支持 ComfyUI 的开源音乐生成模型 | ComfyUI Wiki