SANA-Video 2.0 en 4 Pasos: Vídeo 720p Rápido de NVIDIA
NVIDIA lanza una vista previa destilada en 4 pasos de SANA-Video 2.0 5B: vídeos 720p de 81 fotogramas con BF16 CFG-1 y muestreo de cuatro etapas.
Resumen
La vista previa es una destilación DMD de modelo completo, no un adaptador LoRA: la exportación DMD EMA global-step-1000 se inicializó desde el modelo SANA-Video 2.0 SFT después de la fusión de un adaptador ReFL step-500, luego DMD actualiza todo el transformador. La arquitectura combina capas de atención lineal bidireccional gateadas del 75% con anclas de atención softmax densa periódica del 25% y agregación compartida de Atención Residual cada 8 capas. El codificador de texto es google/gemma-2-2b-it y el VAE es LTX 2.3 con 128 canales latent.
La muestra verificada con semilla-4: un gallo de dibujos animados en una habitación vintage floral, generada con el checkpoint exacto liberado y las configuraciones. Fuente: SANA-Video 2.0 5B 720p 4-step
Contrato de Muestreo de Cuatro Etapas
El modelo no utiliza una trayectoria truncada DPM-Solver. En cada etapa fija el modelo predice velocidad, calcula x0, y vuelve a añadir ruido en el siguiente sigma con un nuevo sorteo del mismo generador con semilla:
| Etapa | Sigma físico | Tiempo de incrustación del modelo |
|---|---|---|
| 1 | 0.9998 | 999 |
| 2 | 0.9472 | 947 |
| 3 | 0.8569 | 856 |
| 4 | 0.6664 | 666 |
La inferencia ejecuta BF16 en CFG 1 con el perfil sigma sana_shift6_dpm y flow_shift deshabilitado. El checkpoint liberado fue evaluado en el conjunto completo VBench T2V (4,730 prompts, las 16 Dimensiones) bajo estas configuraciones exactas.
Disponibilidad
El checkpoint se entrega como un transformador EMA .pth más una configuración de torre fuente limpia de 5B. Hasta que el PR upstream se fusione, la inferencia requiere la rama preview del repositorio Sana (feat/sana-video2-4step-preview) con un VAE LTX 2.3 en formato Diffusers. La versión base de 50 pasos sigue siendo el punto de entrada para TI2V con imagen-conditioning: la vista previa destilada es solo texto-a-vídeo y no soporta conditioning de imagen del primer fotograma.
El vídeo de muestra de cuatro pasos verificado (1280×736, 81 fotogramas, 16 FPS), generado con semilla 4. Fuente: SANA-Video 2.0 5B 720p 4-step
Comentarios
Inicia sesión con GitHub para unirte a la conversación.