MiniMax Music 3: открытая модель генерации музыки с поддержкой ComfyUI
MiniMax выпускает Music 3, открытую модель генерации музыки, создающую полноценные песни до 5 минут с нативной поддержкой ComfyUI.
Обзор
MiniMax Music 3 является открытой моделью генерации музыки от MiniMax и была выпущена вместе с официальной демонстрационной страницей. Она создает структурно целостные песни с выразительным вокалом, развивающимися аранжировками и стабильным качеством длинного аудио, выводя аудио в формате WAV: 32 кГц, 16 бит, стерео.
Официальный баннер MiniMax Music 3
В модели используется иерархическая авторегрессивная архитектура (Hybrid-LM), которая разделяет глобальное музыкальное моделирование и локальное акустическое моделирование:
- Глобальная LLM (8B) предсказывает первый RVQ-кодбук кадр за кадром и моделирует долгосрочное семантическое и структурное развитие песни. Она инициализирована на основе Qwen3-8B.
- Локальная LLM (0.6B) предсказывает оставшиеся акустические кодбуки в каждом кадре и восстанавливает тонкие акустические детали.
- Непрерывная система синтеза скрытых состояний на основе Flow Matching (2.4B) и декодера Flow-VAE (123M) преобразует объединенные скрытые состояния в аудиосигнал, сохраняя артикуляцию вокала и фактуру инструментов.
Архитектура MiniMax Music 3: Hybrid-LM с Flow Matching и синтезом Flow-VAE
Ключевые возможности
Полноценные песни длительностью до 5 минут. Модель нативно поддерживает генерацию целых песен со структурой: интро, куплет, пред-припев, припев, бридж, инструментальный проигрыш и аутро. При этом сохраняются музыкальные темы, ритм, идентичность вокала и развитие аранжировки на протяжении длинных последовательностей.
Управление двумя входами. MiniMax Music 3 принимает два дополняющих друг друга входа:
- Текст песни определяет слова для исполнения и может содержать явные теги разделов, такие как
[Intro],[Verse],[Pre-Chorus],[Chorus],[Bridge],[Instrumental],[Solo]и[Outro]. - Описание музыки определяет музыкальный стиль, эмоциональное развитие, вокальное исполнение, инструментовку, аранжировку и продюсерский профиль. Structured Caption (структурированное описание) с тремя разделами: глобальные метаданные, детали вокала и аранжировка, дает модели точный и детальный контроль над музыкальным развитием песни во времени.
Выразительный вокал. Естественный синтез вокала с контролем над мелодией, произношением и многослойными гармониями.
Музыкальный токенизатор. При обучении используются восемь уровней остаточной векторной квантизации (RVQ): один семантический кодбук с 16 384 элементами и семь акустических кодбуков по 1 024 элемента каждый.
Поддержка в ComfyUI
ComfyUI нативно поддерживает MiniMax Music 3 с официальным примером рабочего процесса, MiniMax Music 3 Text to Music, доступным в библиотеке шаблонов (категория Audio) или в официальном руководстве ComfyUI.
Официальный шаблон рабочего процесса MiniMax Music 3 Text to Music
Готовые для ComfyUI файлы модели (перепакованная diffusion-модель, текстовый энкодер и VAE) размещены в репозитории Comfy-Org/MiniMax-Music-3, а оригинальные веса находятся в MiniMaxAI/MiniMax-Music3.
Веса и варианты
| Файл | Папка | Размер |
|---|---|---|
minimax_music3_dit_fp16.safetensors | diffusion_models | 4.9 GB |
minimax_music3_dit_fp32.safetensors | diffusion_models | 9.8 GB |
minimax_music3_dit_int8_convrot.safetensors | diffusion_models | 2.5 GB |
minimax_music3_text_encoder_bf16.safetensors | text_encoders | 18.5 GB |
minimax_music3_text_encoder_pruned_bf16.safetensors | text_encoders | 16.7 GB |
minimax_music3_text_encoder_pruned_int8_convrot.safetensors | text_encoders | 9.2 GB |
minimax_music3_dav.safetensors | vae | 217 MB |
Модель полной точности помещается в 24 ГБ видеопамяти; с автоматической выгрузкой на CPU генерация занимает около 22 ГБ, а при потоковой загрузке языковой модели слой за слоем она может работать даже на картах с 8 ГБ.
Доступность
Модель поддерживается сервисом SGLang-Omni, а конвейер diffusers доступен в виде модульного конвейера. В ComfyUI обновитесь до последней версии, откройте библиотеку шаблонов и выберите рабочий процесс MiniMax Music 3 Text to Music, который предложит скачать необходимые файлы модели.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.