Aceleración Super NVIDIA H3: Vídeo MiniMax H3 Hasta 27.7x Más Rápido

ComfyUI Wikinews

El motor NVIDIA Sol Engine ejecuta MiniMax H3 como borrador de 4 pasos más 3 de refinamiento LTX: 6.85 s para vídeo 768p de 5 s, hasta 27.7x más rápido que SGLang en una GB200.

Aceleración Super MiniMax H3 (página oficial) es una tubería del motor NVIDIA Sol Engine del Equipo NVIDIA SANA que convierte la generación de vídeo MiniMax H3 en una tarea de dos etapas: un borrador de cuatro pasos 896×512 de H3 con un LoRA de velocidad, luego un paso de refinamiento LTX de tres pasos en la resolución objetivo con Sol-Attn. Medido en una única NVIDIA GB200, un vídeo de 5 segundos 1344×768 se renderiza en 6.85 s y un vídeo de 10 segundos en 14.93 s: 22.2× y 27.7× más rápido que la línea base SGLang publicada.
NVIDIA H3 Super Acceleration: 10-second 1440p city crowd result

Uno de los resultados independientes de 1440p en la página de NVIDIA (10 s, 2560×1440): aceleración de dos etapas, no se registró una línea base coincidente para 1440p.

Cómo funciona

En lugar de ejecutar muchos pasos de denoising H3 a resolución completa, la Aceleración Super H3 realiza la mayor parte del trabajo de generación en un borrador corto de baja resolución y luego restaura el detalle de alta resolución con un paso de refinamiento ligero. Cada etapa es una tarea, y las dos etapas se ejecutan en serie en una GB200:

EtapaModeloResoluciónFPSPasosSalida
Etapa 1 · BorradorMiniMax-H3 + LoRA de velocidad896×512244Vídeo borrador
Etapa 2 · RefinarLTX-2.5 + Sol-Attn768p / 1080p / 2K243Vídeo final

La Etapa 1 genera el vídeo inicial a 896×512 en cuatro pasos de denoising con el LoRA Turbo MiniMax-H3 de LightX2V. La Etapa 2 escala el borrador a la resolución de salida solicitada y ejecuta un paso de tres pasos de Sol-Attn que restaura el detalle y la consistencia de alta resolución. El pipeline no es exacto a nivel de bits con la línea base SGLang: cambia la ruta de muestreo, por lo que pueden aparecer diferencias en el detalle, textura, movimiento o audio: los vídeos emparejados en la página de NVIDIA le permiten juzgar ese compromiso directamente.

Latencia medida

Latencia de extremo a extremo en una NVIDIA GB200, con los últimos resultados Sol-Super usando Sol-Attn para el servicio completo de la Etapa 2:

ResoluciónDuraciónDiffusersSGLangSol EngineSol-Super E2Evs. SGLang
1344×7685 s167.8 s152.3 s45.4 s6.852 s22.2×
1344×76810 s468.2 s414.1 s132.5 s14.931 s27.7×

Los dos aumentos de velocidad provienen de lugares diferentes. La Etapa 1 reemplaza la decodificación VAE oficial de H3 (3.427 s) con el decodificador ligero TAEH3 (0.028 s), y la Etapa 2 reemplaza el decodificador VAE de Vídeo LTX-2.5 denso (6.404 s en una decodificación coincidente de 121 fotogramas) con el refinador Sol-Attn y la decodificación final LTX TAEHV. El codificador de la Etapa 2 se deja intencionalmente sin cambios: el refinador fue entrenado en la distribución VAE latente original de LTX-2.5.

A salida 768p el rendimiento medido resulta en aproximadamente 525 vídeos de cinco segundos por hora en una GB200 totalmente utilizada, frente a 23.6 con la línea base SGLang.

Comparación visual

La página de NVIDIA empareja cada muestra de 768p y 1080p con una ejecución de línea base SGLang coincidente utilizando las mismas entradas de generación:

Línea base SGLangAceleración Super H3
768p 5 s Japanese street, SGLang baseline768p 5 s Japanese street, accelerated
Un hombre y una mujer intercambian un comentario tenso en una calle japonesa concurrida (1344×768, 5 s)Mismas entradas, 22.2× más rápido
Línea base SGLangAceleración Super H3
1080p 5 s bamboo forest, SGLang baseline1080p 5 s bamboo forest, accelerated
Dos artistas marciales se enfrentan en un bosque de bambú (1080p, 5 s)Mismas entradas, acelerado

También se publicaron dos resultados independientes de 1440p (10 s, 2560×1440) sin una línea base coincidente:

Disponibilidad

El pipeline está construido con componentes públicos: el checkpoint oficial MiniMax-H3, el LoRA de cuatro pasos LightX2V MiniMax-H3 Turbo utilizado para el borrador, el checkpoint LTX-2.5 pre-entrenado, y los decodificadores ligeros TAEH3 y LTX TAEHV. Se ejecuta en el motor NVIDIA Sol Engine con Sol-Attn en hardware GB200, y se presenta como una referencia de producción con benchmarks medidos en lugar de un paquete de nodos de ComfyUI. En el momento de la escritura no hay un flujo de trabajo oficial de ComfyUI de NVIDIA para este pipeline: los puertos de la comunidad de componentes individuales del motor Sol Engine (como parcheo de Sol-Attn) han comenzado a aparecer.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Aceleración Super NVIDIA H3: Vídeo MiniMax H3 Hasta 27.7x Más Rápido | ComfyUI Wiki