MiniMax Music 3: настройка в ComfyUI и руководство по модели

ComfyUI Wiki

Запуск MiniMax Music 3 в ComfyUI: официальные чекпойнты Comfy-Org, варианты DiT FP16, FP32 и INT8, урезанные текстовые энкодеры, декодер Flow-VAE и рабочие процессы text-to-music.

M

MiniMax Music 3

Генерация музыкиТекст в музыкуFlow MatchingАудио

MiniMax Music 3 — открытая модель генерации музыки от MiniMax для создания полноценных песен длительностью до пяти минут. Global LLM на 8B и Local LLM на 0.6B управляют синтезатором Flow-Matching и декодером Flow-VAE, создавая стерео WAV 32 кГц из структурированных описаний и текста песен. Официально поддерживается в ComfyUI.

РазработчикMiniMax
Дата выпуска2026-09
АрхитектураHybrid-LM (8B Global + 0.6B Local LLM) с синтезом Flow Matching (2.4B)
Аудиовыход32 кГц, 16-бит стерео WAV
Макс. длинаДо 5 минут на песню
ЛицензияMiniMax Music 3 Community License

MiniMax Music 3 генерирует полноценные песни из двух взаимодополняющих входов: текста песни (с необязательными тегами секций, такими как [Intro], [Verse], [Chorus], [Bridge] и [Outro]) и описания музыки, охватывающего жанр, настроение, инструментарий, вокальное исполнение и продакшн. Модель сохраняет музыкальные темы, ритм, вокальную идентичность и аранжировку на длинных последовательностях, поэтому такие структуры, как интро, куплет, предхорус, припев, бридж и аутро, остаются связными.

Как это работает

MiniMax Music 3 — это иерархическая авторегрессивная модель, которая разделяет глобальную музыкальную структуру и локальные акустические детали:

  • Global LLM на 8B, инициализированная из Qwen3-8B, предсказывает первую кодовую книгу RVQ кадр за кадром и моделирует дальнюю структуру песни.
  • Local LLM на 0.6B предсказывает остальные акустические кодовые книги внутри каждого кадра и восстанавливает мелкодетальные подробности.

Вместо декодирования только из дискретных токенов модуль синтеза объединяет финальные скрытые состояния обеих LLM и пропускает их через этап Flow-Matching на 2.4B в латентное пространство Flow-VAE, а затем через декодер Flow-VAE на 123M, адаптированный из MiniMax Speech. Токенизатор обучения использует восемь слоёв RVQ: одну семантическую кодовую книгу из 16 384 записей плюс семь акустических кодовых книг по 1 024 записи каждая.

Установка

MiniMax Music 3 нативно поддерживается в ComfyUI через официальный перепакованный репозиторий Comfy-Org. Разместите файлы в соответствующих папках:

ФайлНазначение
minimax_music3_dit_fp16.safetensors / minimax_music3_dit_fp32.safetensors / minimax_music3_dit_int8_convrot.safetensorsComfyUI/models/diffusion_models/
minimax_music3_text_encoder_bf16.safetensors / minimax_music3_text_encoder_pruned_bf16.safetensors / minimax_music3_text_encoder_pruned_int8_convrot.safetensorsComfyUI/models/text_encoders/
minimax_music3_dav.safetensorsComfyUI/models/vae/

DiT поставляется в вариантах FP16 (около 4.9 ГБ), FP32 и INT8 convrot; текстовый энкодер объединяет Global LLM на 8B и Local LLM на 0.6B, а урезанные варианты BF16 и INT8 convrot позволяют уменьшить занимаемый объём.

Ресурсы

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…