MiniMax H3 Turbo LoRA v4: generación de audio-vídeo en 2 pasos

ComfyUI Wikinews

La Turbo LoRA v4 (step 600) reduce la generación audiovisual de MiniMax H3 a 2-3 pasos de muestreo, con nodos ComfyUI actualizados y un flujo de trabajo incluido.

larryvrh publicó la v4 del Turbo LoRA de MiniMax H3, y la carrera por reducir los pasos sigue acelerándose: el nuevo checkpoint minimax_h3_turbo_v4_step600_ema.safetensors renderiza de forma nativa en 3 pasos, y las pruebas de la comunidad consiguieron una pasada funcional de 2 pasos con audio limpio (Hugging Face). Reemplaza los archivos anteriores ckpt500 / ckpt850 como la opción predeterminada recomendada, con un microdetalle notablemente mejor y el aspecto "plástico" sobrenitidado de la línea v1 anterior totalmente resuelto.

Fotograma de ejemplo de MiniMax H3 Turbo LoRA v4

Salida de ejemplo compartida en el repositorio de conversión del Turbo LoRA (drbaph)

Novedades de la v4

El lanzamiento de la v4 es una nueva receta de entrenamiento, no solo otro recuento de pasos. Con 600 pasos de entrenamiento, es el checkpoint más potente que larryvrh ha publicado hasta ahora:

  • Mejora de fotogramas estáticos: una gran ventaja para el contenido estático y de movimiento reducido
  • Mejor microdetalle: rostros, dedos y texturas finas se aprecian con más claridad
  • Sin sobrenitidado: el aspecto plástico de la línea v1 anterior (~850) ha desaparecido

El único inconveniente aparece solo con 4 pasos y movimiento amplio y rápido, donde la v4 puede producir desenfoque de movimiento / estelas fantasma. Usar 6-8 pasos lo elimina en gran medida; para el caso específico de 4 pasos con movimiento intenso, el checkpoint v1 (~850) anterior sigue siendo la opción más recomendable. La línea v4 también tolera mejor recuentos de pasos más altos que la v1, que tiende a sobrenitidar con pasos altos y fuerza 1.0.

Pasos y configuraciones

El README recomienda 4-8 pasos (4 es el mínimo, 6-8 se ven notablemente mejor), fuerza 1.0 y el scheduler simple. Las pruebas de la comunidad en el Discord de MiniMax H3 llegaron a un punto óptimo similar con fuerza 0.6-0.8 y 6-10 pasos, y confirmaron que la pasada de 2 pasos funciona con el audio intacto (la salida de vídeo es un poco más suave). El entrenamiento continúa, con el audio y el comportamiento de movimiento rápido marcados como las dos áreas que aún se están mejorando.

Uso en ComfyUI

Los nodos personalizados actualizados de ComfyUI-MiniMax-H3-Turbo ahora cubren todos los modelos base: un solo archivo LoRA funciona con los checkpoints bf16 / int8 completos y las variantes de curva podadas; el nodo detecta automáticamente una base podada y reinyecta el conditioning temporal en tiempo de ejecución. Un interruptor low_vram fusiona el LoRA en los pesos para lograr el pico de VRAM más bajo, y el Sampler Turbo de MiniMax-H3 incluido se adapta automáticamente a tu versión de ComfyUI (las compilaciones recientes gestionan de forma nativa los flujos duales de vídeo/audio mediante ModelSamplingAV; las compilaciones antiguas usan la ruta propia del nodo).

El repositorio del nodo incluye un flujo de trabajo de texto a vídeo listo para usar:

Checkpoints podados (drbaph)

Para el cargador de LoRA de MiniMax-H3 integrado en ComfyUI, drbaph publicó conversiones de modelos podados de los pesos de la v4 en MiniMax-H3-Turbo-Lora-ComfyUI: minimax_h3_turbo_v4_step600_ema_pruned_comfyui.safetensors (recomendado), junto con la variante sin EMA, con un flujo de trabajo de ejemplo (fl_minimax_h3_turbo_lora_example_workflow.json). Su configuración inicial recomendada es 6-8 pasos, sampler Euler, scheduler Beta, fuerza 1.0.

Salida de demostración del flujo de trabajo EMA v4 de paso 600 recomendado, compartida por drbaph

Disponibilidad

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 Turbo LoRA v4: generación de audio-vídeo en 2 pasos | ComfyUI Wiki