MiniMax Music 3: modelo abierto de música con soporte ComfyUI

ComfyUI Wikinews

MiniMax lanza Music 3, un modelo de música abierto que crea canciones completas de hasta 5 minutos con voces expresivas, y soporte nativo para ComfyUI.

MiniMax ha lanzado Music 3, un modelo abierto de generación musical que crea canciones completas de hasta cinco minutos a partir de letras y una descripción musical estructurada. Tiene soporte nativo en ComfyUI con un flujo de trabajo de ejemplo oficial, y los pesos listos para ComfyUI están disponibles en Hugging Face.

Información general

MiniMax Music 3 es el modelo abierto de generación musical de MiniMax, lanzado junto con la página de demostración oficial. Genera canciones estructuralmente coherentes con voces expresivas, arreglos en evolución y una calidad de audio estable de formato largo, produciendo audio WAV estéreo de 32 kHz y 16 bits.

Banner de MiniMax Music 3

Banner oficial de MiniMax Music 3

El modelo utiliza una arquitectura autorregresiva jerárquica (Hybrid-LM) que separa el modelado musical global del modelado acústico local:

  • El Global LLM (8B) predice el primer codebook RVQ frame a frame y modela la progresión semántica y estructural de largo alcance de la canción. Se inicializa a partir de Qwen3-8B.
  • El Local LLM (0.6B) predice los codebooks acústicos restantes dentro de cada frame y restaura el detalle acústico de grano fino.
  • Un sistema de síntesis de estados ocultos continuos basado en Flow Matching (2.4B) y un decodificador Flow-VAE (123M) convierte los estados ocultos fusionados en audio de forma de onda, preservando la articulación vocal y la textura instrumental.
Arquitectura de MiniMax Music 3

Arquitectura de MiniMax Music 3: Hybrid-LM con síntesis Flow Matching y Flow-VAE

Características principales

Canciones completas de hasta 5 minutos. El modelo soporta de forma nativa la generación de canciones completas con estructura como intro, verso, pre-coro, coro, puente, pausa instrumental y outro, manteniendo temas musicales, ritmo, identidad vocal y progresión de arreglos a lo largo de secuencias largas.

Control con dos entradas. MiniMax Music 3 acepta dos entradas complementarias:

  • Las letras definen las palabras que se cantarán y pueden incluir etiquetas de sección explícitas como [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Instrumental], [Solo] y [Outro].
  • La descripción musical define el estilo musical, la progresión emocional, la interpretación vocal, la instrumentación, el arreglo y el perfil de producción. Una Descripción Estructurada con tres secciones: Metadatos globales, Detalles vocales y Arreglo, le da al modelo un control preciso y de grano fino sobre el desarrollo musical de la canción a lo largo del tiempo.

Voces expresivas. Síntesis vocal natural con control sobre la melodía, la pronunciación y las armonías en capas.

Music tokenizer. El entrenamiento utiliza ocho capas de cuantización vectorial residual (RVQ): un codebook semántico con 16 384 entradas más siete codebooks acústicos con 1 024 entradas cada uno.

Soporte de ComfyUI

ComfyUI soporta MiniMax Music 3 de forma nativa con un flujo de trabajo de ejemplo oficial: MiniMax Music 3 Text to Music, disponible en la Biblioteca de Plantillas (categoría Audio) o desde el tutorial oficial de ComfyUI.

Flujo de trabajo de MiniMax Music 3 en ComfyUI

Plantilla oficial del flujo de trabajo MiniMax Music 3 Text to Music

Los archivos de modelo listos para ComfyUI (modelo de difusión reempaquetado, codificador de texto y VAE) están alojados en el repositorio Comfy-Org/MiniMax-Music-3, con los pesos originales en MiniMaxAI/MiniMax-Music3.

Pesos y variantes

ArchivoCarpetaTamaño
minimax_music3_dit_fp16.safetensorsdiffusion_models4.9 GB
minimax_music3_dit_fp32.safetensorsdiffusion_models9.8 GB
minimax_music3_dit_int8_convrot.safetensorsdiffusion_models2.5 GB
minimax_music3_text_encoder_bf16.safetensorstext_encoders18.5 GB
minimax_music3_text_encoder_pruned_bf16.safetensorstext_encoders16.7 GB
minimax_music3_text_encoder_pruned_int8_convrot.safetensorstext_encoders9.2 GB
minimax_music3_dav.safetensorsvae217 MB

El modelo de precisión completa cabe en menos de 24 GB de VRAM; con descarga automática a la CPU, la generación ocupa unos 22 GB, y transmitiendo el modelo de lenguaje capa por capa puede caber incluso en tarjetas de 8 GB.

Disponibilidad

El modelo se puede servir con SGLang-Omni y hay un pipeline de diffusers disponible como pipeline modular. En ComfyUI, actualiza a la última versión, abre la Biblioteca de Plantillas y elige el flujo de trabajo MiniMax Music 3 Text to Music, que te pedirá que descargues los archivos de modelo requeridos.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax Music 3: modelo abierto de música con soporte ComfyUI | ComfyUI Wiki