MiniMax Music 3: configuración en ComfyUI y guía del modelo
Ejecuta MiniMax Music 3 en ComfyUI: checkpoints oficiales Comfy-Org, variantes DiT FP16, FP32 e INT8, codificadores podados y flujos de texto a música.
MiniMax Music 3
Music GenerationText to MusicFlow MatchingAudioMiniMax Music 3 es el modelo abierto de generación musical de MiniMax para canciones completas de hasta cinco minutos. Un Global LLM de 8B y un Local LLM de 0.6B impulsan un sintetizador Flow-Matching y un decodificador Flow-VAE para producir audio WAV estéreo de 32 kHz a partir de descripciones estructuradas y letras. Es compatible oficialmente con ComfyUI.
| Desarrollador | MiniMax |
| Fecha de lanzamiento | 2026-09 |
| Arquitectura | Hybrid-LM (8B Global + 0.6B Local LLM) con síntesis Flow Matching (2.4B) |
| Salida de audio | 32 kHz, WAV estéreo de 16 bits |
| Longitud máxima | Hasta 5 minutos por canción |
| Licencia | MiniMax Music 3 Community License |
MiniMax Music 3 genera canciones completas a partir de dos entradas complementarias: las letras (con etiquetas de sección opcionales como [Intro], [Verse], [Chorus], [Bridge] y [Outro]) y una descripción musical que abarca género, ambiente, instrumentación, interpretación vocal y producción. Mantiene los temas musicales, el ritmo, la identidad vocal y los arreglos a lo largo de secuencias largas, de modo que estructuras como intro, verso, pre-estribillo, estribillo, puente y outro se mantienen coherentes.
Cómo funciona
MiniMax Music 3 es un modelo autoregresivo jerárquico que separa la estructura musical global del detalle acústico local:
- El 8B Global LLM, inicializado a partir de Qwen3-8B, predice el primer codebook RVQ frame a frame y modela la estructura de largo alcance de la canción.
- El 0.6B Local LLM predice los codebooks acústicos restantes dentro de cada frame y restaura el detalle fino.
En lugar de decodificar únicamente a partir de tokens discretos, el módulo de síntesis fusiona los estados ocultos finales de ambos LLM y los hace pasar por una etapa de Flow-Matching de 2.4B hacia el latente del Flow-VAE, y después por un decodificador Flow-VAE de 123M adaptado de MiniMax Speech. El tokenizador de entrenamiento utiliza ocho capas RVQ: un codebook semántico de 16,384 entradas más siete codebooks acústicos de 1,024 entradas cada uno.
Instalación
MiniMax Music 3 es compatible de forma nativa con ComfyUI a través del repositorio oficial reempaquetado por Comfy-Org. Coloca los archivos en sus carpetas correspondientes:
| Archivo | Destino |
|---|---|
minimax_music3_dit_fp16.safetensors / minimax_music3_dit_fp32.safetensors / minimax_music3_dit_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ |
minimax_music3_text_encoder_bf16.safetensors / minimax_music3_text_encoder_pruned_bf16.safetensors / minimax_music3_text_encoder_pruned_int8_convrot.safetensors | ComfyUI/models/text_encoders/ |
minimax_music3_dav.safetensors | ComfyUI/models/vae/ |
El DiT se distribuye en variantes FP16 (unos 4.9 GB), FP32 e INT8 convrot; el codificador de texto combina un Global LLM de 8B y un Local LLM de 0.6B, con opciones BF16 podado e INT8 convrot podado para reducir el tamaño.
Recursos
- Tutorial de MiniMax Music 3 en ComfyUI (documentación oficial)
- Flujo de trabajo de texto a música de MiniMax Music 3 (plantilla oficial)
- Noticias sobre Music Production Toolkit
- Demo de MiniMax Music 3
Guides and workflows related to this model series.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.