Aperçu SANA-Video 2.0 en 4 étapes : Modèle Vidéo Rapide 720p de NVIDIA

ComfyUI Wikinews

NVIDIA publie un aperçu distillé par DMD en 4 étapes de SANA-Video 2.0 5B : vidéos 720p de 81 images, inférence BF16 CFG-1 et échantillonnage en quatre phases.

L'équipe SANA de NVIDIA a publié un aperçu de recherche distillé en 4 étapes de SANA-Video 2.0 5B 720p : Efficient-Large-Model/SANA-Video_2.0_5B_720p_4step. Le checkpoint génère du texte vers vidéo 736×1280, 81 images (16 FPS) en seulement quatre étapes d'échantillonnage. Source : README du dépôt HF.

Aperçu

L'aperçu est une distillation DMD du modèle complet, pas un adaptateur LoRA : l'exportation EMA étape globale-1000 DMD a été initialisée à partir du modèle SFT SANA-Video 2.0 après la fusion d'un adaptateur étape-500 ReFL, puis DMD met à jour tout le transformer. L'architecture combine 75 % de couches d'attention linéaire bidirectionnelle à porte avec 25 % d'ancres d'attention softmax dense périodique et une agrégation résiduelle Attention partagée tous les 8 calques. L'encodeur de texte est google/gemma-2-2b-it et le VAE est LTX 2.3 avec 128 canaux latents.

SANA-Video 2.0 4-step preview sample

L'échantillon vérifié graine-4 : un coq cartoon dans une pièce vintage florale, généré avec le checkpoint exact et les paramètres publiés. Source : SANA-Video 2.0 5B 720p en 4 étapes

Contrat d'échantillonnage en quatre étapes

Le modèle n'utilise pas une trajectoire DPM-Solver tronquée. À chaque étape fixe, le modèle prédit la vitesse, calcule x0, et renuance au sigma suivant avec un tirage frais du même générateur graine :

StageSigma physiquePas de temps du modèle
10.9998999
20.9472947
30.8569856
40.6664666

L'inférence s'exécute en BF16 à CFG 1 avec le profil sigma sana_shift6_dpm et flow_shift désactivé. Le checkpoint publié a été évalué sur la suite complète VBench T2V (4 730 prompts, toutes les 16 dimensions) dans ces paramètres exacts.

Disponibilité

Le checkpoint est livré sous forme d'un transformateur EMA .pth plus une configuration source-tower propre de 5B. Jusqu'à ce que la PR upstream soit fusionnée, l'inférence nécessite la branche aperçu du Référentiel Sana (feat/sana-video2-4step-preview) avec un VAE LTX 2.3 au format Diffusers. La version de base 50 étapes reste le point d'entrée pour le TI2V conditionné par image : l'aperçu distillé est uniquement texte vers vidéo et ne prend pas en charge le conditionnement d'image de première frame.

La vidéo échantillon vérifiée en quatre étapes (1280×736, 81 images, 16 FPS), générée avec la graine 4. Source : SANA-Video 2.0 5B 720p en 4 étapes

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Aperçu SANA-Video 2.0 en 4 étapes : Modèle Vidéo Rapide 720p de NVIDIA | ComfyUI Wiki