FastH3 v1 : Distillation MiniMax H3 en 4 étapes par FastVideo
FastVideo publie FastH3 v1 : distillation DMD2 en 4 étapes de MiniMax H3 avec attention éparse à 90 %, jusqu'à 14x plus rapide sur les GPU Blackwell.
FastVideo, en collaboration avec Nuva Lab et l'équipe NVIDIA FastGen, a ouvert en open-source l'Aperçu FastH3 v1, une version distillée en 4 étapes de MiniMax H3 pour la génération de texte vers Vidéo-et-audio (checkpoint | blog | GitHub). Il remplace les 49 appels de transformateur du Modèle de base par 4 et ajoute une attention éparse à 90 %, atteignant jusqu'à 14x d'accélération sur un seul GPU NVIDIA Blackwell.
Aperçu FastH3 v1 : MiniMax H3 distillé éparse en 4 étapes à poids ouverts provenant de FastVideo
Vitesse benchmarkée
Sur matériel B200 à 1344x768 et 24 FPS avec audio, le checkpoint RECOMMANDÉ / Data-Free génère un clip de 15 secondes en 47,2 secondes sur un B200 (14,38x plus rapide que le modèle dense de base) et 15,5 secondes sur huit B200, avec des clips de 5s et 10s à 16,2s et 31,1s sur un seul GPU. Les chronos couvrent le pipeline complet : encodage, débruitage, décodage, audio, multiplexage et sortie de fichier.
Comment fonctionne la distillation
FastH3 réduit les coûts de deux manières :
- Quatre appels au lieu de 49. La distillation par appariement de distributions (DMD2) entraîne un élève contre un professeur Base H3 figé avec un critique appris. Les exécutions uniquement sur prompt utilisent la simulation inverse ; une variante de données synthétiques démarre à partir de latents vidéo-et-audio Base-H3 bruitées vers l'avant.
- Moins de travail d'attention par appel. L'élève adopte VSA (attention éparse entraînable pour la diffusion vidéo) à 90 % de sparsité, s'exécutant sur le noyau CUDA VSA tile-64 de FastVideo avec compilation DiT régionale, fusions H3 et un VAE vidéo compilé.
Contenu de la version
| Élément | Dépôt | Remarques |
|---|---|---|
| Checkpoint complet | FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree | Aperçu v1 RECOMMANDÉ, nécessite le backend d'attention VSA-H3 |
| LoRA pré-extrait | FastVideo-FastH3-4-step-Preview-v1-LoRA | Inclut un adaptateur VSA-datafree ainsi que des ablations dense et données synthétiques |
| Code d'Inférence | hao-ai-lab/FastVideo | Supplément fasth3 avec des wheels de noyau CUDA publiés ; code d'entraînment Bientôt disponible |
Les checkpoints sont entraînés et validés à plusieurs rapports d'aspect, y compris carré, portrait, paysage et ultralarge 768p, avec des hauteurs et largeurs Personnalisées en multiples de 32. Ils réutilisent le encodeur de texte H3-Base, le VAE vidéo, le VAE audio, les tokenizers et les planificateurs.
Portée et disponibilité ComfyUI
L'Aperçu v1 couvre uniquement le texte vers Vidéo et audio : FL2VA (conditionnement d'image première trame) et Ref2VA (conditionnement d'image de référence) n'ont pas été distillés, et le mouvement difficile, les détails fins et certains audio peuvent être inférieurs au modèle de base. FastVideo liste le support image-référence, la quantification NVFP4, les optimisations RTX / DGX Spark / Apple MLX, et de nouvelles exécutions avec la Méthode PDD de NVIDIA sur la feuille de route.
Pour les utilisateurs ComfyUI Aujourd'hui, FastH3 est une publication de pile FastVideo plutôt qu'un checkpoint prêt à l'emploi : les adaptateurs VSA nécessitent le backend VSA-H3 et les lanceurs de FastVideo, pas un chargeur LoRA générique. L'accélération native ComfyUI pour H3 provient actuellement de LoRAs de distillation tels que H3 Turbo-SLA et PDD Acc LoRA, qui s'exécutent sur les Flux de travail H3 ComfyUI standards. Un chemin compatible ComfyUI pour FastH3 vaut la peine d'être surveillé alors que l'équipe apporte les Modèles au matériel grand public.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.