FastH3 v1: Destilación MiniMax H3 de 4 Pasos de FastVideo
FastVideo libera FastH3 v1: destilación DMD2 de 4 pasos de MiniMax H3 con 90% de atención dispersa, hasta 14 veces más rápido texto-a-vídeo-y-audio en GPUs Blackwell.
FastVideo, en colaboración con Nuva Lab y el Equipo NVIDIA FastGen, ha liberado Open Source FastH3 Vista Previa v1, una versión destilada de 4 pasos de MiniMax H3 para generación de texto-a-vídeo-y-audio (checkpoint | blog | GitHub). Reemplaza las 49 llamadas del transformador del Modelo base por 4 y añade 90% de Atención dispersa, alcanzando hasta un aumento de velocidad de 14x en una sola GPU NVIDIA Blackwell.
FastH3 Vista Previa v1: MiniMax H3 destilado disperso de 4 pasos de peso abierto de FastVideo
Velocidad evaluada
En hardware B200 a 1344x768 y 24 FPS con audio, el checkpoint VSA / Data-Free RECOMENDADO genera un clip de 15 segundos en 47.2 segundos en una B200 (14.38x más rápido que el modelo base denso) y 15.5 segundos en ocho B200, con clips de 5s y 10s a 16.2s y 31.1s en una sola GPU. Los tiempos cubren todo el flujo: codificación, denoising, decodificación, audio, multiplexado y salida de archivo.
Cómo funciona la destilación
FastH3 reduce costos de dos formas:
- Cuatro llamadas en lugar de 49. La Destilación de Coincidencia de Distribución (DMD2) entrena a un estudiante contra un maestro Base H3 congelado con un crítico aprendido. Las ejecuciones solo con prompt usan simulación hacia atrás; una variante de datos sintéticos comienza desde latentes de vídeo-audio Base-H3 con ruido hacia adelante.
- Menos trabajo de atención por llamada. El estudiante adopta VSA (Atención dispersa entrenable para difusión de vídeo) al 90% de esparsidad, ejecutándose en el núcleo CUDA VSA tile-64 de FastVideo con compilación DiT regional, fusiones H3 y un VAE de vídeo compilado.
Qué hay en el lanzamiento
| Elemento | Repositorio | Notas |
|---|---|---|
| Checkpoint completo | FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree | Vista Previa v1 RECOMENDADA, requiere el backend de Atención VSA-H3 |
| LoRA pre-extraído | FastVideo-FastH3-4-step-Preview-v1-LoRA | Incluye un adaptador VSA-datafree además de ablativos densos y de datos sintéticos |
| Código de Inferencia | hao-ai-lab/FastVideo | fasth3 extra con ruedas de núcleo CUDA publicadas; código de entrenamiento Próximamente |
Los checkpoints se entrenan y validan en múltiples proporciones de aspecto, incluyendo cuadrado, retrato, paisaje y ultrawide 768p, con alturas y anchos Personalizados en múltiplos de 32. Reutilizan el codificador de texto H3-Base, VAE de vídeo, VAE de audio, tokenizadores y programadores.
Alcance y disponibilidad de ComfyUI
La Vista Previa v1 cubre texto-a-vídeo-y-audio únicamente: FL2VA (acondicionamiento de imagen de primer cuadro) y Ref2VA (acondicionamiento de imagen de referencia) no fueron destilados, y el movimiento difícil, los detalles finos y algunos audio pueden estar por debajo del modelo base. FastVideo lista soporte de referencia de imagen, cuantización NVFP4, optimizaciones RTX / DGX Spark / Apple MLX, y nuevas ejecuciones con el Método PDD de NVIDIA en la hoja de ruta.
Para usuarios de ComfyUI hoy, FastH3 es un lanzamiento de pila FastVideo en lugar de un checkpoint de relleno directo: los adaptadores VSA necesitan el backend VSA-H3 de FastVideo y lanzadores, no un cargador de LoRA genérico. La aceleración nativa de ComfyUI para H3 proviene actualmente de LoRAs de destilación como H3 Turbo-SLA y PDD Acc LoRA, que se ejecutan en flujos de trabajo H3 estándar de ComfyUI. Un camino compatible con ComfyUI para FastH3 vale la pena vigilar mientras el equipo lleva los modelos al hardware de consumo.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.