MiniMax Music 3: modelo abierto de música con soporte ComfyUI
MiniMax lanza Music 3, un modelo de música abierto que crea canciones completas de hasta 5 minutos con voces expresivas, y soporte nativo para ComfyUI.
Información general
MiniMax Music 3 es el modelo abierto de generación musical de MiniMax, lanzado junto con la página de demostración oficial. Genera canciones estructuralmente coherentes con voces expresivas, arreglos en evolución y una calidad de audio estable de formato largo, produciendo audio WAV estéreo de 32 kHz y 16 bits.
Banner oficial de MiniMax Music 3
El modelo utiliza una arquitectura autorregresiva jerárquica (Hybrid-LM) que separa el modelado musical global del modelado acústico local:
- El Global LLM (8B) predice el primer codebook RVQ frame a frame y modela la progresión semántica y estructural de largo alcance de la canción. Se inicializa a partir de Qwen3-8B.
- El Local LLM (0.6B) predice los codebooks acústicos restantes dentro de cada frame y restaura el detalle acústico de grano fino.
- Un sistema de síntesis de estados ocultos continuos basado en Flow Matching (2.4B) y un decodificador Flow-VAE (123M) convierte los estados ocultos fusionados en audio de forma de onda, preservando la articulación vocal y la textura instrumental.
Arquitectura de MiniMax Music 3: Hybrid-LM con síntesis Flow Matching y Flow-VAE
Características principales
Canciones completas de hasta 5 minutos. El modelo soporta de forma nativa la generación de canciones completas con estructura como intro, verso, pre-coro, coro, puente, pausa instrumental y outro, manteniendo temas musicales, ritmo, identidad vocal y progresión de arreglos a lo largo de secuencias largas.
Control con dos entradas. MiniMax Music 3 acepta dos entradas complementarias:
- Las letras definen las palabras que se cantarán y pueden incluir etiquetas de sección explícitas como
[Intro],[Verse],[Pre-Chorus],[Chorus],[Bridge],[Instrumental],[Solo]y[Outro]. - La descripción musical define el estilo musical, la progresión emocional, la interpretación vocal, la instrumentación, el arreglo y el perfil de producción. Una Descripción Estructurada con tres secciones: Metadatos globales, Detalles vocales y Arreglo, le da al modelo un control preciso y de grano fino sobre el desarrollo musical de la canción a lo largo del tiempo.
Voces expresivas. Síntesis vocal natural con control sobre la melodía, la pronunciación y las armonías en capas.
Music tokenizer. El entrenamiento utiliza ocho capas de cuantización vectorial residual (RVQ): un codebook semántico con 16 384 entradas más siete codebooks acústicos con 1 024 entradas cada uno.
Soporte de ComfyUI
ComfyUI soporta MiniMax Music 3 de forma nativa con un flujo de trabajo de ejemplo oficial: MiniMax Music 3 Text to Music, disponible en la Biblioteca de Plantillas (categoría Audio) o desde el tutorial oficial de ComfyUI.
Plantilla oficial del flujo de trabajo MiniMax Music 3 Text to Music
Los archivos de modelo listos para ComfyUI (modelo de difusión reempaquetado, codificador de texto y VAE) están alojados en el repositorio Comfy-Org/MiniMax-Music-3, con los pesos originales en MiniMaxAI/MiniMax-Music3.
Pesos y variantes
| Archivo | Carpeta | Tamaño |
|---|---|---|
minimax_music3_dit_fp16.safetensors | diffusion_models | 4.9 GB |
minimax_music3_dit_fp32.safetensors | diffusion_models | 9.8 GB |
minimax_music3_dit_int8_convrot.safetensors | diffusion_models | 2.5 GB |
minimax_music3_text_encoder_bf16.safetensors | text_encoders | 18.5 GB |
minimax_music3_text_encoder_pruned_bf16.safetensors | text_encoders | 16.7 GB |
minimax_music3_text_encoder_pruned_int8_convrot.safetensors | text_encoders | 9.2 GB |
minimax_music3_dav.safetensors | vae | 217 MB |
El modelo de precisión completa cabe en menos de 24 GB de VRAM; con descarga automática a la CPU, la generación ocupa unos 22 GB, y transmitiendo el modelo de lenguaje capa por capa puede caber incluso en tarjetas de 8 GB.
Disponibilidad
El modelo se puede servir con SGLang-Omni y hay un pipeline de diffusers disponible como pipeline modular. En ComfyUI, actualiza a la última versión, abre la Biblioteca de Plantillas y elige el flujo de trabajo MiniMax Music 3 Text to Music, que te pedirá que descargues los archivos de modelo requeridos.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.