MiniMax H3 Turbo LoRA: Vista previa de generación de audio y vídeo en 4 pasos
Una LoRA comunitaria genera vídeo de MiniMax H3 con audio estéreo sincronizado en 4 pasos de muestreo en lugar de ~20. Se incluyen la conversión para ComfyUI y un flujo de trabajo de ejemplo.
Una LoRA comunitaria para MiniMax H3 genera vídeo junto con audio estéreo sincronizado en 4 pasos de muestreo en lugar de los ~20 habituales, una aceleración de aproximadamente 5x en el tiempo de muestreo. Publicada el 5 de agosto por larryvrh como una vista previa temprana, es la primera LoRA de velocidad para el modelo H3 de pesos abiertos (lee la historia de los pesos abiertos).
Este es un prototipo temprano. Los pesos y las herramientas de ComfyUI son un trabajo en progreso: 4 pasos funcionan pero el resultado es notablemente más suave, y 6-8 pasos son la zona de confort actual para la nitidez. Trátalo como una vista previa, no como un producto finalizado.
Pesos
Todos los archivos son bf16, de aproximadamente 744 MB, y se aplican como una actualización de rango bajo estándar (W_eff = W + lora_B @ lora_A, alfa es igual al rango, sin escalado adicional). La LoRA apunta al transformador base de H3; los streams de vídeo y audio se ejecutan con dos programaciones de flujo diferentes, por lo que un sampler estándar aplica pasos de más al audio en 4 pasos y lo rompe. El nodo de sampler personalizado se encarga de esto.
| Archivo | ~Pasos de entrenamiento | Notas |
|---|---|---|
minimax_h3_turbo_4step_ckpt500.safetensors | ~500 | Recomendado por defecto: el más reciente y nítido (no-EMA) |
minimax_h3_turbo_4step_ema_ckpt500.safetensors | ~500 | Variante de promedio temporal: más suave, pero puede mostrar ghosting en este checkpoint temprano |
minimax_h3_turbo_4step.safetensors | ~200 | Versión inicial, no-EMA |
minimax_h3_turbo_4step_ema.safetensors | ~200 | Versión inicial, promedio temporal (reemplazada) |
La LoRA requiere un checkpoint base no podado: el modelo de diffusion convrot bf16 o INT8 completo. Las variantes podadas usan una capa de time-conditioning diferente y no son compatibles. Hay una conversión compatible con modelos podados disponible por separado (ver abajo).
Uso en ComfyUI
La versión original necesita Nodos Personalizados (ComfyUI-MiniMax-H3-Turbo, instalables mediante ComfyUI-Manager o git clone en custom_nodes) además de un archivo minimax_h3_turbo_4step*.safetensors en models/loras/:
- Instala los Nodos Personalizados.
- Descarga un
.safetensorsenComfyUI/models/loras/. - Parte del flujo de trabajo oficial de pesos abiertos de MiniMax H3, inserta la Turbo LoRA entre el cargador de modelo y el sampler, y reemplaza el sampler por el MiniMax-H3 Turbo Sampler (4-step) con el scheduler configurado en
simple.
Se incluye un flujo de trabajo de texto a vídeo ya preparado en el repositorio (minimax_h3_t2v_turbo.json) y en los flujos de trabajo de ejemplo del repositorio de nodos.
Esto no es soporte nativo de ComfyUI: la LoRA de velocidad depende de los Nodos Personalizados de terceros
ComfyUI-MiniMax-H3-Turbo.
Conversión para modelos podados
Los checkpoints de H3 podados/en forma de curva que usa ComfyUI necesitan una conversión de claves. drbaph publicó minimax_h3_turbo_4step_ckpt500_pruned_comfyui.safetensors (además de una variante EMA) en MiniMax-H3-Turbo-Lora-ComfyUI, que se carga con el cargador de LoRA MiniMax-H3 integrado de ComfyUI, e incluyó un flujo de trabajo de ejemplo (fl_minimax_h3_turbo_lora_example_workflow.json). QrusherZA también publicó una conversión podada de un solo archivo en H3_Turbo_ComfyUI.
Las primeras pruebas de la comunidad con fuerza de LoRA 1.0 y Euler/Beta reportan una salida nítida en 4 pasos; el stream de audio es el punto débil actual de este checkpoint temprano.
Disponibilidad
- Pesos originales: larryvrh/MiniMax-H3-Turbo-Lora (Apache-2.0)
- Nodos Personalizados: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Conversión para modelos podados: drbaph/MiniMax-H3-Turbo-Lora-ComfyUI, QrusherZA/H3_Turbo_ComfyUI
- Catálogo: entradas de Turbo LoRA añadidas a la página del modelo MiniMax H3 con el nodo personalizado requerido marcado
Comentarios
Inicia sesión con GitHub para unirte a la conversación.