MiniMax Music Production Toolkit: estudio musical en ComfyUI
Pack de nodos MIT gratuito que convierte ComfyUI en un estudio para MiniMax Music 3: prompts de cancion por LLM, 62 presets, FlashSR a 48 kHz y portadas FLUX.2 automaticas.
La cadena de producción completa: planificación de canciones con LLM, generación con Music 3, mejora de audio y arte de portada con FLUX.2 en un único flujo de trabajo.
Prompts de canciones sin necesidad de aprender el formato de prompts
En lugar de redactar a mano las captions y las letras de MiniMax Music 3, eliges lo que quieres en los menús desplegables: género, tempo, tonalidad, idioma, voz, modo de letra y duración objetivo. A continuación, un LLM local (cualquier GGUF mediante el nodo de chat llama.cpp incluido, por ejemplo Qwen o Gemma) escribe el plan completo de la canción: caption, letra, título e incluso un prompt para el arte de portada.
El analizador estructurado extrae [Caption], [Lyrics], [Title] e [Image_Prompt] de la respuesta del LLM, con campos de respaldo manuales si desactivas la sección del LLM. El paquete incluye una biblioteca de 62 presets de género (EDM, house, metal, folk, clásica y más) con metadatos que rellenan automáticamente todos los campos.
La cadena de mejora de audio
La propuesta del toolkit es una salida audiblemente mejor que la de Music 3 sin procesar, mediante una cadena de procesamiento fija:
- Reparación de declip / sobrecarga: reconstrucción conservadora de las crestas de la forma de onda con recorte duro antes de continuar con el procesamiento.
- Filtrado de paso bajo PRE/POST: limitación de banda antes y después de la mejora para evitar artefactos.
- Superresolución FlashSR: un nodo FlashSR integrado amplía el audio a 48 kHz y sustituye al nodo externo Egregora de las versiones anteriores; solo los pesos se descargan en la primera utilización.
- Crossover híbrido y reparación de platillos / brillo: combina la señal original con la superresuelta y reduce el sustain acuoso en las altas frecuencias, a la vez que conserva los ataques.
- Preparación para el lanzamiento: ganancia estática de LUFS / pico verdadero (true peak) y remuestreo, sin compresor ni ajuste de sonoridad variable en el tiempo.
La salida se guarda como FLAC/MP3/WAV con la nomenclatura correcta [Album] - [Title], etiquetas incrustadas y un JSON de producción que permite recrear o modificar cada canción más tarde. Ese mismo JSON alimenta el catálogo de demostración de 25 pistas en GitHub Pages; el set de SoundCloud del autor incluye ejemplos de canciones completas.
Autocontenido en la versión 2.0
La versión 2.0.1 eliminó las últimas dependencias de nodos externos: los nodos integrados MiniMaxFlashSRAudio, MiniMaxLLMChat y MiniMaxLLMUnload hacen que el flujo de trabajo de ejemplo utilice únicamente nodos del toolkit y del núcleo (core). Otras novedades incluyen una rama de arte de portada con FLUX.2 (imagen cuadrada; el tamaño también controla la resolución de la portada incrustada), descarga automática declarativa de modelos mediante models_config.json, soporte multi-GPU con el LLM en su propia tarjeta gráfica y migración automática de los flujos de trabajo guardados antes de la versión 2.0.
Disponibilidad
Puedes instalarlo desde ComfyUI Manager buscando "MiniMax Music Production Toolkit". Necesitas los archivos del modelo MiniMax Music 3, como en cualquier configuración de Music 3, además de un GGUF de LLM local para la etapa de prompts; todo lo demás se descarga automáticamente.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.