MiniMax Music 3: открытая модель генерации музыки с поддержкой ComfyUI

ComfyUI Wikinews

MiniMax выпускает Music 3, открытую модель генерации музыки, создающую полноценные песни до 5 минут с нативной поддержкой ComfyUI.

Компания MiniMax выпустила Music 3, открытую модель генерации музыки, которая создает полноценные песни длительностью до пяти минут на основе текста и структурированного музыкального описания. Модель нативно поддерживается в ComfyUI с официальным примером рабочего процесса, а готовые для ComfyUI веса доступны на Hugging Face.

Обзор

MiniMax Music 3 является открытой моделью генерации музыки от MiniMax и была выпущена вместе с официальной демонстрационной страницей. Она создает структурно целостные песни с выразительным вокалом, развивающимися аранжировками и стабильным качеством длинного аудио, выводя аудио в формате WAV: 32 кГц, 16 бит, стерео.

Баннер MiniMax Music 3

Официальный баннер MiniMax Music 3

В модели используется иерархическая авторегрессивная архитектура (Hybrid-LM), которая разделяет глобальное музыкальное моделирование и локальное акустическое моделирование:

  • Глобальная LLM (8B) предсказывает первый RVQ-кодбук кадр за кадром и моделирует долгосрочное семантическое и структурное развитие песни. Она инициализирована на основе Qwen3-8B.
  • Локальная LLM (0.6B) предсказывает оставшиеся акустические кодбуки в каждом кадре и восстанавливает тонкие акустические детали.
  • Непрерывная система синтеза скрытых состояний на основе Flow Matching (2.4B) и декодера Flow-VAE (123M) преобразует объединенные скрытые состояния в аудиосигнал, сохраняя артикуляцию вокала и фактуру инструментов.
Архитектура MiniMax Music 3

Архитектура MiniMax Music 3: Hybrid-LM с Flow Matching и синтезом Flow-VAE

Ключевые возможности

Полноценные песни длительностью до 5 минут. Модель нативно поддерживает генерацию целых песен со структурой: интро, куплет, пред-припев, припев, бридж, инструментальный проигрыш и аутро. При этом сохраняются музыкальные темы, ритм, идентичность вокала и развитие аранжировки на протяжении длинных последовательностей.

Управление двумя входами. MiniMax Music 3 принимает два дополняющих друг друга входа:

  • Текст песни определяет слова для исполнения и может содержать явные теги разделов, такие как [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Instrumental], [Solo] и [Outro].
  • Описание музыки определяет музыкальный стиль, эмоциональное развитие, вокальное исполнение, инструментовку, аранжировку и продюсерский профиль. Structured Caption (структурированное описание) с тремя разделами: глобальные метаданные, детали вокала и аранжировка, дает модели точный и детальный контроль над музыкальным развитием песни во времени.

Выразительный вокал. Естественный синтез вокала с контролем над мелодией, произношением и многослойными гармониями.

Музыкальный токенизатор. При обучении используются восемь уровней остаточной векторной квантизации (RVQ): один семантический кодбук с 16 384 элементами и семь акустических кодбуков по 1 024 элемента каждый.

Поддержка в ComfyUI

ComfyUI нативно поддерживает MiniMax Music 3 с официальным примером рабочего процесса, MiniMax Music 3 Text to Music, доступным в библиотеке шаблонов (категория Audio) или в официальном руководстве ComfyUI.

Рабочий процесс MiniMax Music 3 в ComfyUI

Официальный шаблон рабочего процесса MiniMax Music 3 Text to Music

Готовые для ComfyUI файлы модели (перепакованная diffusion-модель, текстовый энкодер и VAE) размещены в репозитории Comfy-Org/MiniMax-Music-3, а оригинальные веса находятся в MiniMaxAI/MiniMax-Music3.

Веса и варианты

ФайлПапкаРазмер
minimax_music3_dit_fp16.safetensorsdiffusion_models4.9 GB
minimax_music3_dit_fp32.safetensorsdiffusion_models9.8 GB
minimax_music3_dit_int8_convrot.safetensorsdiffusion_models2.5 GB
minimax_music3_text_encoder_bf16.safetensorstext_encoders18.5 GB
minimax_music3_text_encoder_pruned_bf16.safetensorstext_encoders16.7 GB
minimax_music3_text_encoder_pruned_int8_convrot.safetensorstext_encoders9.2 GB
minimax_music3_dav.safetensorsvae217 MB

Модель полной точности помещается в 24 ГБ видеопамяти; с автоматической выгрузкой на CPU генерация занимает около 22 ГБ, а при потоковой загрузке языковой модели слой за слоем она может работать даже на картах с 8 ГБ.

Доступность

Модель поддерживается сервисом SGLang-Omni, а конвейер diffusers доступен в виде модульного конвейера. В ComfyUI обновитесь до последней версии, откройте библиотеку шаблонов и выберите рабочий процесс MiniMax Music 3 Text to Music, который предложит скачать необходимые файлы модели.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax Music 3: открытая модель генерации музыки с поддержкой ComfyUI | ComfyUI Wiki