MiniMax Music 3 : installation dans ComfyUI et guide du modèle

ComfyUI Wiki

Exécutez MiniMax Music 3 dans ComfyUI : checkpoints officiels Comfy-Org, variantes DiT FP16, FP32 et INT8, encodeurs de texte pruned et flux text-to-music.

M

MiniMax Music 3

Music GenerationText to MusicFlow MatchingAudio

MiniMax Music 3 est le modèle ouvert de génération musicale de MiniMax, capable de produire des chansons complètes allant jusqu'à cinq minutes. Un LLM Global de 8B et un LLM Local de 0,6B pilotent un synthétiseur Flow-Matching et un décodeur Flow-VAE pour générer de l'audio WAV stéréo à 32 kHz à partir de légendes structurées et de paroles. Il est officiellement pris en charge dans ComfyUI.

MiniMax Music 3 génère des chansons complètes à partir de deux entrées complémentaires : les paroles (avec des balises de section facultatives telles que [Intro], [Verse], [Chorus], [Bridge] et [Outro]) et une description musicale couvrant le genre, l'ambiance, l'instrumentation, la performance vocale et la production. Il maintient les thèmes musicaux, le rythme, l'identité vocale et l'arrangement sur de longues séquences, de sorte que des structures comme intro, couplet, pré-refrain, refrain, pont et outro restent cohérentes.

Fonctionnement

MiniMax Music 3 est un modèle autoregressif hiérarchique qui sépare la structure musicale globale du détail acoustique local :

  • Le LLM Global de 8B, initialisé à partir de Qwen3-8B, prédit la première trame du RVQ codebook image par image et modélise la structure à long terme de la chanson.
  • Le LLM Local de 0,6B prédit les codebooks acoustiques restants au sein de chaque trame et restaure les détails fins.

Au lieu de décoder uniquement à partir de tokens discrets, le module de synthèse fusionne les états cachés finaux des deux LLM et les fait passer par une étape Flow-Matching de 2,4B vers le latent Flow-VAE, puis par un décodeur Flow-VAE de 123M adapté de MiniMax Speech. Le tokenizer d'entraînement utilise huit couches RVQ : un codebook sémantique de 16 384 entrées plus sept codebooks acoustiques de 1 024 entrées chacun.

Installation

MiniMax Music 3 est nativement pris en charge dans ComfyUI via le référentiel officiel repackagé par Comfy-Org. Placez les fichiers dans leurs dossiers respectifs :

FichierDestination
minimax_music3_dit_fp16.safetensors / minimax_music3_dit_fp32.safetensors / minimax_music3_dit_int8_convrot.safetensorsComfyUI/models/diffusion_models/
minimax_music3_text_encoder_bf16.safetensors / minimax_music3_text_encoder_pruned_bf16.safetensors / minimax_music3_text_encoder_pruned_int8_convrot.safetensorsComfyUI/models/text_encoders/
minimax_music3_dav.safetensorsComfyUI/models/vae/

Le DiT est fourni en variantes FP16 (environ 4,9 Go), FP32 et INT8 convrot ; l'encodeur de texte combine un LLM Global de 8B et un LLM Local de 0,6B, avec des options pruned BF16 et pruned INT8 convrot pour une empreinte réduite.

Ressources

Guides and workflows related to this model series.

No articles found.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…