MiniMax Music 3: настройка в ComfyUI и руководство по модели
Запуск MiniMax Music 3 в ComfyUI: официальные чекпойнты Comfy-Org, варианты DiT FP16, FP32 и INT8, урезанные текстовые энкодеры, декодер Flow-VAE и рабочие процессы text-to-music.
MiniMax Music 3
Генерация музыкиТекст в музыкуFlow MatchingАудиоMiniMax Music 3 — открытая модель генерации музыки от MiniMax для создания полноценных песен длительностью до пяти минут. Global LLM на 8B и Local LLM на 0.6B управляют синтезатором Flow-Matching и декодером Flow-VAE, создавая стерео WAV 32 кГц из структурированных описаний и текста песен. Официально поддерживается в ComfyUI.
| Разработчик | MiniMax |
| Дата выпуска | 2026-09 |
| Архитектура | Hybrid-LM (8B Global + 0.6B Local LLM) с синтезом Flow Matching (2.4B) |
| Аудиовыход | 32 кГц, 16-бит стерео WAV |
| Макс. длина | До 5 минут на песню |
| Лицензия | MiniMax Music 3 Community License |
MiniMax Music 3 генерирует полноценные песни из двух взаимодополняющих входов: текста песни (с необязательными тегами секций, такими как [Intro], [Verse], [Chorus], [Bridge] и [Outro]) и описания музыки, охватывающего жанр, настроение, инструментарий, вокальное исполнение и продакшн. Модель сохраняет музыкальные темы, ритм, вокальную идентичность и аранжировку на длинных последовательностях, поэтому такие структуры, как интро, куплет, предхорус, припев, бридж и аутро, остаются связными.
Как это работает
MiniMax Music 3 — это иерархическая авторегрессивная модель, которая разделяет глобальную музыкальную структуру и локальные акустические детали:
- Global LLM на 8B, инициализированная из Qwen3-8B, предсказывает первую кодовую книгу RVQ кадр за кадром и моделирует дальнюю структуру песни.
- Local LLM на 0.6B предсказывает остальные акустические кодовые книги внутри каждого кадра и восстанавливает мелкодетальные подробности.
Вместо декодирования только из дискретных токенов модуль синтеза объединяет финальные скрытые состояния обеих LLM и пропускает их через этап Flow-Matching на 2.4B в латентное пространство Flow-VAE, а затем через декодер Flow-VAE на 123M, адаптированный из MiniMax Speech. Токенизатор обучения использует восемь слоёв RVQ: одну семантическую кодовую книгу из 16 384 записей плюс семь акустических кодовых книг по 1 024 записи каждая.
Установка
MiniMax Music 3 нативно поддерживается в ComfyUI через официальный перепакованный репозиторий Comfy-Org. Разместите файлы в соответствующих папках:
| Файл | Назначение |
|---|---|
minimax_music3_dit_fp16.safetensors / minimax_music3_dit_fp32.safetensors / minimax_music3_dit_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
minimax_music3_text_encoder_bf16.safetensors / minimax_music3_text_encoder_pruned_bf16.safetensors / minimax_music3_text_encoder_pruned_int8_convrot.safetensors | ComfyUI/models/text_encoders/ |
minimax_music3_dav.safetensors | ComfyUI/models/vae/ |
DiT поставляется в вариантах FP16 (около 4.9 ГБ), FP32 и INT8 convrot; текстовый энкодер объединяет Global LLM на 8B и Local LLM на 0.6B, а урезанные варианты BF16 и INT8 convrot позволяют уменьшить занимаемый объём.
Ресурсы
- Учебник по MiniMax Music 3 в ComfyUI (официальная документация)
- Рабочий процесс text-to-music для MiniMax Music 3 (официальный шаблон)
- Новости Music Production Toolkit
- Демо MiniMax Music 3
Guides and workflows related to this model series.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.