Aceleración Super NVIDIA H3: Vídeo MiniMax H3 Hasta 27.7x Más Rápido
El motor NVIDIA Sol Engine ejecuta MiniMax H3 como borrador de 4 pasos más 3 de refinamiento LTX: 6.85 s para vídeo 768p de 5 s, hasta 27.7x más rápido que SGLang en una GB200.
Uno de los resultados independientes de 1440p en la página de NVIDIA (10 s, 2560×1440): aceleración de dos etapas, no se registró una línea base coincidente para 1440p.
Cómo funciona
En lugar de ejecutar muchos pasos de denoising H3 a resolución completa, la Aceleración Super H3 realiza la mayor parte del trabajo de generación en un borrador corto de baja resolución y luego restaura el detalle de alta resolución con un paso de refinamiento ligero. Cada etapa es una tarea, y las dos etapas se ejecutan en serie en una GB200:
| Etapa | Modelo | Resolución | FPS | Pasos | Salida |
|---|---|---|---|---|---|
| Etapa 1 · Borrador | MiniMax-H3 + LoRA de velocidad | 896×512 | 24 | 4 | Vídeo borrador |
| Etapa 2 · Refinar | LTX-2.5 + Sol-Attn | 768p / 1080p / 2K | 24 | 3 | Vídeo final |
La Etapa 1 genera el vídeo inicial a 896×512 en cuatro pasos de denoising con el LoRA Turbo MiniMax-H3 de LightX2V. La Etapa 2 escala el borrador a la resolución de salida solicitada y ejecuta un paso de tres pasos de Sol-Attn que restaura el detalle y la consistencia de alta resolución. El pipeline no es exacto a nivel de bits con la línea base SGLang: cambia la ruta de muestreo, por lo que pueden aparecer diferencias en el detalle, textura, movimiento o audio: los vídeos emparejados en la página de NVIDIA le permiten juzgar ese compromiso directamente.
Latencia medida
Latencia de extremo a extremo en una NVIDIA GB200, con los últimos resultados Sol-Super usando Sol-Attn para el servicio completo de la Etapa 2:
| Resolución | Duración | Diffusers | SGLang | Sol Engine | Sol-Super E2E | vs. SGLang |
|---|---|---|---|---|---|---|
| 1344×768 | 5 s | 167.8 s | 152.3 s | 45.4 s | 6.852 s | 22.2× |
| 1344×768 | 10 s | 468.2 s | 414.1 s | 132.5 s | 14.931 s | 27.7× |
Los dos aumentos de velocidad provienen de lugares diferentes. La Etapa 1 reemplaza la decodificación VAE oficial de H3 (3.427 s) con el decodificador ligero TAEH3 (0.028 s), y la Etapa 2 reemplaza el decodificador VAE de Vídeo LTX-2.5 denso (6.404 s en una decodificación coincidente de 121 fotogramas) con el refinador Sol-Attn y la decodificación final LTX TAEHV. El codificador de la Etapa 2 se deja intencionalmente sin cambios: el refinador fue entrenado en la distribución VAE latente original de LTX-2.5.
A salida 768p el rendimiento medido resulta en aproximadamente 525 vídeos de cinco segundos por hora en una GB200 totalmente utilizada, frente a 23.6 con la línea base SGLang.
Comparación visual
La página de NVIDIA empareja cada muestra de 768p y 1080p con una ejecución de línea base SGLang coincidente utilizando las mismas entradas de generación:
| Línea base SGLang | Aceleración Super H3 |
|---|---|
![]() | ![]() |
| Un hombre y una mujer intercambian un comentario tenso en una calle japonesa concurrida (1344×768, 5 s) | Mismas entradas, 22.2× más rápido |
| Línea base SGLang | Aceleración Super H3 |
|---|---|
![]() | ![]() |
| Dos artistas marciales se enfrentan en un bosque de bambú (1080p, 5 s) | Mismas entradas, acelerado |
También se publicaron dos resultados independientes de 1440p (10 s, 2560×1440) sin una línea base coincidente:
Disponibilidad
El pipeline está construido con componentes públicos: el checkpoint oficial MiniMax-H3, el LoRA de cuatro pasos LightX2V MiniMax-H3 Turbo utilizado para el borrador, el checkpoint LTX-2.5 pre-entrenado, y los decodificadores ligeros TAEH3 y LTX TAEHV. Se ejecuta en el motor NVIDIA Sol Engine con Sol-Attn en hardware GB200, y se presenta como una referencia de producción con benchmarks medidos en lugar de un paquete de nodos de ComfyUI. En el momento de la escritura no hay un flujo de trabajo oficial de ComfyUI de NVIDIA para este pipeline: los puertos de la comunidad de componentes individuales del motor Sol Engine (como parcheo de Sol-Attn) han comenzado a aparecer.




Comentarios
Inicia sesión con GitHub para unirte a la conversación.