Aperçu SANA-Video 2.0 en 4 étapes : Modèle Vidéo Rapide 720p de NVIDIA
NVIDIA publie un aperçu distillé par DMD en 4 étapes de SANA-Video 2.0 5B : vidéos 720p de 81 images, inférence BF16 CFG-1 et échantillonnage en quatre phases.
Aperçu
L'aperçu est une distillation DMD du modèle complet, pas un adaptateur LoRA : l'exportation EMA étape globale-1000 DMD a été initialisée à partir du modèle SFT SANA-Video 2.0 après la fusion d'un adaptateur étape-500 ReFL, puis DMD met à jour tout le transformer. L'architecture combine 75 % de couches d'attention linéaire bidirectionnelle à porte avec 25 % d'ancres d'attention softmax dense périodique et une agrégation résiduelle Attention partagée tous les 8 calques. L'encodeur de texte est google/gemma-2-2b-it et le VAE est LTX 2.3 avec 128 canaux latents.
L'échantillon vérifié graine-4 : un coq cartoon dans une pièce vintage florale, généré avec le checkpoint exact et les paramètres publiés. Source : SANA-Video 2.0 5B 720p en 4 étapes
Contrat d'échantillonnage en quatre étapes
Le modèle n'utilise pas une trajectoire DPM-Solver tronquée. À chaque étape fixe, le modèle prédit la vitesse, calcule x0, et renuance au sigma suivant avec un tirage frais du même générateur graine :
| Stage | Sigma physique | Pas de temps du modèle |
|---|---|---|
| 1 | 0.9998 | 999 |
| 2 | 0.9472 | 947 |
| 3 | 0.8569 | 856 |
| 4 | 0.6664 | 666 |
L'inférence s'exécute en BF16 à CFG 1 avec le profil sigma sana_shift6_dpm et flow_shift désactivé. Le checkpoint publié a été évalué sur la suite complète VBench T2V (4 730 prompts, toutes les 16 dimensions) dans ces paramètres exacts.
Disponibilité
Le checkpoint est livré sous forme d'un transformateur EMA .pth plus une configuration source-tower propre de 5B. Jusqu'à ce que la PR upstream soit fusionnée, l'inférence nécessite la branche aperçu du Référentiel Sana (feat/sana-video2-4step-preview) avec un VAE LTX 2.3 au format Diffusers. La version de base 50 étapes reste le point d'entrée pour le TI2V conditionné par image : l'aperçu distillé est uniquement texte vers vidéo et ne prend pas en charge le conditionnement d'image de première frame.
La vidéo échantillon vérifiée en quatre étapes (1280×736, 81 images, 16 FPS), générée avec la graine 4. Source : SANA-Video 2.0 5B 720p en 4 étapes
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.