SANA-Video 2.0 en 4 Pasos: Vídeo 720p Rápido de NVIDIA

ComfyUI Wikinews

NVIDIA lanza una vista previa destilada en 4 pasos de SANA-Video 2.0 5B: vídeos 720p de 81 fotogramas con BF16 CFG-1 y muestreo de cuatro etapas.

El Equipo SANA de NVIDIA lanzó una vista previa de investigación destilada en 4 pasos de SANA-Video 2.0 5B 720p: Efficient-Large-Model/SANA-Video_2.0_5B_720p_4step. El checkpoint genera vídeo texto-a-vídeo de 736×1280, 81 fotogramas (16 FPS) en solo cuatro etapas de muestreo. Fuente: README del repositorio HF.

Resumen

La vista previa es una destilación DMD de modelo completo, no un adaptador LoRA: la exportación DMD EMA global-step-1000 se inicializó desde el modelo SANA-Video 2.0 SFT después de la fusión de un adaptador ReFL step-500, luego DMD actualiza todo el transformador. La arquitectura combina capas de atención lineal bidireccional gateadas del 75% con anclas de atención softmax densa periódica del 25% y agregación compartida de Atención Residual cada 8 capas. El codificador de texto es google/gemma-2-2b-it y el VAE es LTX 2.3 con 128 canales latent.

SANA-Video 2.0 4-step preview sample

La muestra verificada con semilla-4: un gallo de dibujos animados en una habitación vintage floral, generada con el checkpoint exacto liberado y las configuraciones. Fuente: SANA-Video 2.0 5B 720p 4-step

Contrato de Muestreo de Cuatro Etapas

El modelo no utiliza una trayectoria truncada DPM-Solver. En cada etapa fija el modelo predice velocidad, calcula x0, y vuelve a añadir ruido en el siguiente sigma con un nuevo sorteo del mismo generador con semilla:

EtapaSigma físicoTiempo de incrustación del modelo
10.9998999
20.9472947
30.8569856
40.6664666

La inferencia ejecuta BF16 en CFG 1 con el perfil sigma sana_shift6_dpm y flow_shift deshabilitado. El checkpoint liberado fue evaluado en el conjunto completo VBench T2V (4,730 prompts, las 16 Dimensiones) bajo estas configuraciones exactas.

Disponibilidad

El checkpoint se entrega como un transformador EMA .pth más una configuración de torre fuente limpia de 5B. Hasta que el PR upstream se fusione, la inferencia requiere la rama preview del repositorio Sana (feat/sana-video2-4step-preview) con un VAE LTX 2.3 en formato Diffusers. La versión base de 50 pasos sigue siendo el punto de entrada para TI2V con imagen-conditioning: la vista previa destilada es solo texto-a-vídeo y no soporta conditioning de imagen del primer fotograma.

El vídeo de muestra de cuatro pasos verificado (1280×736, 81 fotogramas, 16 FPS), generado con semilla 4. Fuente: SANA-Video 2.0 5B 720p 4-step

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
SANA-Video 2.0 en 4 Pasos: Vídeo 720p Rápido de NVIDIA | ComfyUI Wiki