MiniMax Music 3 : un modèle open source de musique avec ComfyUI
MiniMax publie Music 3, un modèle de génération musicale open source qui crée des chansons complètes jusqu'à 5 minutes, avec prise en charge native de ComfyUI.
Vue d'ensemble
MiniMax Music 3 est le modèle open source de génération musicale de MiniMax, publié aux côtés de la page de démonstration officielle. Il génère des chansons structurellement cohérentes avec des voix expressives, des arrangements évolutifs et une qualité audio stable sur de longues durées, produisant un audio WAV stéréo 32 kHz en 16 bits.
Bannière officielle de MiniMax Music 3
Le modèle utilise une architecture autoregressive hiérarchique (Hybrid-LM) qui sépare la modélisation musicale globale de la modélisation acoustique locale :
- Le Global LLM (8B) prédit le premier codebook RVQ trame par trame et modélise la progression sémantique et structurelle à long terme de la chanson. Il est initialisé à partir de Qwen3-8B.
- Le Local LLM (0,6B) prédit les codebooks acoustiques restants dans chaque trame et restaure les détails acoustiques fins.
- Un système de synthèse à états cachés continus basé sur le Flow Matching (2,4B) et un décodeur Flow-VAE (123M) convertit les états cachés fusionnés en audio sous forme d'onde, en préservant l'articulation vocale et la texture instrumentale.
Architecture MiniMax Music 3 : Hybrid-LM avec synthèse Flow Matching et Flow-VAE
Fonctionnalités clés
Des chansons complètes jusqu'à 5 minutes. Le modèle prend nativement en charge la génération de chansons complètes avec une structure telle que intro, couplet, pré-refrain, refrain, pont, pause instrumentale et outro, en maintenant les thèmes musicaux, le rythme, l'identité vocale et la progression des arrangements sur de longues séquences.
Un contrôle à deux entrées. MiniMax Music 3 accepte deux entrées complémentaires :
- Les paroles définissent les mots à chanter et peuvent inclure des balises de section explicites telles que
[Intro],[Verse],[Pre-Chorus],[Chorus],[Bridge],[Instrumental],[Solo]et[Outro]. - La description musicale définit le style musical, la progression émotionnelle, la performance vocale, l'instrumentation, l'arrangement et le profil de production. Une description structurée composée de trois sections — métadonnées globales, détails vocaux et arrangement — donne au modèle un contrôle précis et fin sur le développement musical de la chanson au fil du temps.
Des voix expressives. Synthèse vocale naturelle avec contrôle de la mélodie, de la prononciation et des harmonies superposées.
Tokenizer musical. L'entraînement utilise huit couches de quantification vectorielle résiduelle (RVQ) : un codebook sémantique de 16 384 entrées plus sept codebooks acoustiques de 1 024 entrées chacun.
Prise en charge de ComfyUI
ComfyUI prend nativement en charge MiniMax Music 3 avec un flux de travail d'exemple officiel — MiniMax Music 3 Text to Music — disponible dans la bibliothèque de modèles (catégorie Audio) ou dans le tutoriel officiel ComfyUI.
Modèle de flux de travail officiel MiniMax Music 3 Text to Music
Les fichiers de modèle prêts pour ComfyUI — modèle de diffusion réempaqueté, encodeur de texte et VAE — sont hébergés dans le référentiel Comfy-Org/MiniMax-Music-3, tandis que les poids d'origine se trouvent dans MiniMaxAI/MiniMax-Music3.
Poids et variantes
| Fichier | Dossier | Taille |
|---|---|---|
minimax_music3_dit_fp16.safetensors | diffusion_models | 4,9 Go |
minimax_music3_dit_fp32.safetensors | diffusion_models | 9,8 Go |
minimax_music3_dit_int8_convrot.safetensors | diffusion_models | 2,5 Go |
minimax_music3_text_encoder_bf16.safetensors | text_encoders | 18,5 Go |
minimax_music3_text_encoder_pruned_bf16.safetensors | text_encoders | 16,7 Go |
minimax_music3_text_encoder_pruned_int8_convrot.safetensors | text_encoders | 9,2 Go |
minimax_music3_dav.safetensors | vae | 217 Mo |
Le modèle en pleine précision tient dans moins de 24 Go de VRAM ; avec le déchargement automatique vers le CPU, la génération nécessite environ 22 Go, et le streaming du modèle de langage couche par couche peut tenir même sur des cartes de 8 Go.
Disponibilité
Le modèle est pris en charge par SGLang-Omni pour le serving, et un pipeline diffusers est disponible sous forme de pipeline modulaire. Dans ComfyUI, mettez à jour vers la dernière version, ouvrez la bibliothèque de modèles et choisissez le flux de travail MiniMax Music 3 Text to Music, qui vous invite à télécharger les fichiers de modèle requis.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.