MiniMax Music Production Toolkit : studio musical dans ComfyUI
Un pack de noeuds MIT gratuit fait de ComfyUI un studio de production MiniMax Music 3 : prompts par LLM, 62 prereglages de genre, FlashSR 48 kHz et pochettes FLUX.2.
La chaîne de production complète : planification des chansons par LLM, génération Music 3, amélioration audio et pochettes FLUX.2 dans un seul flux de travail.
Des prompts de chansons sans avoir à apprendre le format de prompt
Au lieu de rédiger à la main les captions et les paroles de MiniMax Music 3, vous choisissez ce que vous voulez dans des menus déroulants : genre, tempo, tonalité, langue, voix, mode de paroles et durée cible. Un LLM local (n'importe quel GGUF via un nœud de chat llama.cpp intégré, par exemple Qwen ou Gemma) rédige ensuite le plan complet de la chanson : caption, paroles, titre et même un prompt de pochette.
Le parseur structuré extrait [Caption], [Lyrics], [Title] et [Image_Prompt] de la réponse du LLM, avec des champs de secours manuels si vous désactivez la section LLM. Une bibliothèque intégrée de 62 préréglages de genre (EDM, house, metal, folk, classique et plus encore) est fournie avec des métadonnées qui préremplissent chaque champ.
La chaîne d'amélioration audio
L'argument principal du toolkit est une sortie audiblement meilleure que celle du Music 3 brut, grâce à une chaîne de traitement fixe :
- Dé-écrêtage / réparation de surcharge : reconstruction prudente des sommets de forme d'onde fortement écrêtés avant tout traitement ultérieur.
- Filtrage passe-bas PRE/POST : limitation de bande avant et après l'amélioration pour éviter les artefacts.
- Super-résolution FlashSR : un nœud FlashSR intégré met à l'échelle l'audio jusqu'à 48 kHz, en remplacement du nœud externe Egregora utilisé dans les versions antérieures ; seuls les poids sont téléchargés lors de la première utilisation.
- Crossover hybride et réparation cymbales/scintillement : mélange du signal original et du signal super-résolu, réduction du sustain aigu aqueux tout en préservant les attaques.
- Préparation de sortie : gain statique LUFS/crête réelle et rééchantillonnage, sans compresseur ni ajustement de loudness variable dans le temps.
La sortie est livrée en FLAC/MP3/WAV, avec un nommage correct [Album] - [Title], des balises intégrées et un JSON de production qui permet de recréer ou de modifier chaque chanson plus tard. Ce même JSON alimente un catalogue de démonstration de 25 pistes sur GitHub Pages ; le set SoundCloud de l'auteur contient des exemples en version intégrale.
Entièrement autonome en v2.0
La version 2.0.1 a supprimé les dernières dépendances de nœuds externes : grâce aux nœuds intégrés MiniMaxFlashSRAudio, MiniMaxLLMChat et MiniMaxLLMUnload, le flux de travail d'exemple n'utilise que les nœuds du toolkit et les nœuds de base. Parmi les autres ajouts : une branche de génération de pochette FLUX.2 (visuel carré dont la taille contrôle également la résolution de la pochette intégrée), le téléchargement automatique des modèles en mode déclaratif via models_config.json, la prise en charge multi-GPU avec le LLM sur sa propre carte graphique, et la migration automatique des flux de travail enregistrés avant la v2.0.
Disponibilité
Installez-le depuis ComfyUI Manager en recherchant « MiniMax Music Production Toolkit ». Vous avez besoin des fichiers du modèle MiniMax Music 3, comme pour toute installation Music 3, ainsi que d'un GGUF LLM local pour l'étape des prompts ; tout le reste se télécharge tout seul.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.