MiniMax Music 3 : un modèle open source de musique avec ComfyUI

ComfyUI Wikinews

MiniMax publie Music 3, un modèle de génération musicale open source qui crée des chansons complètes jusqu'à 5 minutes, avec prise en charge native de ComfyUI.

MiniMax a publié Music 3, un modèle open source de génération musicale qui crée des chansons complètes d'une durée maximale de cinq minutes à partir de paroles et d'une description musicale structurée. Il est pris en charge nativement dans ComfyUI avec un flux de travail d'exemple officiel, et les poids prêts pour ComfyUI sont disponibles sur Hugging Face.

Vue d'ensemble

MiniMax Music 3 est le modèle open source de génération musicale de MiniMax, publié aux côtés de la page de démonstration officielle. Il génère des chansons structurellement cohérentes avec des voix expressives, des arrangements évolutifs et une qualité audio stable sur de longues durées, produisant un audio WAV stéréo 32 kHz en 16 bits.

Bannière MiniMax Music 3

Bannière officielle de MiniMax Music 3

Le modèle utilise une architecture autoregressive hiérarchique (Hybrid-LM) qui sépare la modélisation musicale globale de la modélisation acoustique locale :

  • Le Global LLM (8B) prédit le premier codebook RVQ trame par trame et modélise la progression sémantique et structurelle à long terme de la chanson. Il est initialisé à partir de Qwen3-8B.
  • Le Local LLM (0,6B) prédit les codebooks acoustiques restants dans chaque trame et restaure les détails acoustiques fins.
  • Un système de synthèse à états cachés continus basé sur le Flow Matching (2,4B) et un décodeur Flow-VAE (123M) convertit les états cachés fusionnés en audio sous forme d'onde, en préservant l'articulation vocale et la texture instrumentale.
Architecture MiniMax Music 3

Architecture MiniMax Music 3 : Hybrid-LM avec synthèse Flow Matching et Flow-VAE

Fonctionnalités clés

Des chansons complètes jusqu'à 5 minutes. Le modèle prend nativement en charge la génération de chansons complètes avec une structure telle que intro, couplet, pré-refrain, refrain, pont, pause instrumentale et outro, en maintenant les thèmes musicaux, le rythme, l'identité vocale et la progression des arrangements sur de longues séquences.

Un contrôle à deux entrées. MiniMax Music 3 accepte deux entrées complémentaires :

  • Les paroles définissent les mots à chanter et peuvent inclure des balises de section explicites telles que [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Instrumental], [Solo] et [Outro].
  • La description musicale définit le style musical, la progression émotionnelle, la performance vocale, l'instrumentation, l'arrangement et le profil de production. Une description structurée composée de trois sections — métadonnées globales, détails vocaux et arrangement — donne au modèle un contrôle précis et fin sur le développement musical de la chanson au fil du temps.

Des voix expressives. Synthèse vocale naturelle avec contrôle de la mélodie, de la prononciation et des harmonies superposées.

Tokenizer musical. L'entraînement utilise huit couches de quantification vectorielle résiduelle (RVQ) : un codebook sémantique de 16 384 entrées plus sept codebooks acoustiques de 1 024 entrées chacun.

Prise en charge de ComfyUI

ComfyUI prend nativement en charge MiniMax Music 3 avec un flux de travail d'exemple officiel — MiniMax Music 3 Text to Music — disponible dans la bibliothèque de modèles (catégorie Audio) ou dans le tutoriel officiel ComfyUI.

Flux de travail ComfyUI MiniMax Music 3

Modèle de flux de travail officiel MiniMax Music 3 Text to Music

Les fichiers de modèle prêts pour ComfyUI — modèle de diffusion réempaqueté, encodeur de texte et VAE — sont hébergés dans le référentiel Comfy-Org/MiniMax-Music-3, tandis que les poids d'origine se trouvent dans MiniMaxAI/MiniMax-Music3.

Poids et variantes

FichierDossierTaille
minimax_music3_dit_fp16.safetensorsdiffusion_models4,9 Go
minimax_music3_dit_fp32.safetensorsdiffusion_models9,8 Go
minimax_music3_dit_int8_convrot.safetensorsdiffusion_models2,5 Go
minimax_music3_text_encoder_bf16.safetensorstext_encoders18,5 Go
minimax_music3_text_encoder_pruned_bf16.safetensorstext_encoders16,7 Go
minimax_music3_text_encoder_pruned_int8_convrot.safetensorstext_encoders9,2 Go
minimax_music3_dav.safetensorsvae217 Mo

Le modèle en pleine précision tient dans moins de 24 Go de VRAM ; avec le déchargement automatique vers le CPU, la génération nécessite environ 22 Go, et le streaming du modèle de langage couche par couche peut tenir même sur des cartes de 8 Go.

Disponibilité

Le modèle est pris en charge par SGLang-Omni pour le serving, et un pipeline diffusers est disponible sous forme de pipeline modulaire. Dans ComfyUI, mettez à jour vers la dernière version, ouvrez la bibliothèque de modèles et choisissez le flux de travail MiniMax Music 3 Text to Music, qui vous invite à télécharger les fichiers de modèle requis.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax Music 3 : un modèle open source de musique avec ComfyUI | ComfyUI Wiki