FastH3 8-Step V2 : des modèles ComfyUI natifs officiels
FastVideo FastH3 8-Step V2 natif dans ComfyUI : modèles t2v et premier/dernier frame, réglages VSA BlockSparseAttention et checkpoint de Comfy-Org.
Lors du lancement de FastH3 Preview v1 fin août, l'exécuter dans ComfyUI n'était pas réaliste : les adaptateurs VSA nécessitaient les lanceurs propres à FastVideo, et nous orientions plutôt les utilisateurs de ComfyUI vers des LoRA de distillation comme H3 Turbo-SLA et PDD Acc LoRA. La situation a changé. FastVideo a publié un checkpoint 8-Step V2, Comfy-Org l'a repackagé pour ComfyUI, et le dépôt officiel de modèles de flux de travail contient désormais deux modèles FastH3 natifs.
Le modèle officiel text-to-video FastH3 dans le navigateur de modèles de ComfyUI.
Le checkpoint 8-Step V2
FastVideo-FastH3-8-Step-V2 est une distillation DMD2 sans données de MiniMax H3, entraînée avec l'attention VSA-H3 à 80 % de sparsité. Il génère de la vidéo et de l'audio synchronisés en 8 passes forward du transformer au lieu du calendrier complet du modèle de base, et cette génération arrive avec un changement permissif : le README du checkpoint documente directement les exigences d'attention, il peut donc être servi en dehors de la pile FastVideo tant que le motif d'attention sparse est reproduit à l'inférence.
Comfy-Org a repackagé le transformer distillé sous le nom fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors dans le dépôt Comfy-Org/FastVideo-FastH3, qui redirige désormais vers FastH3-Comfy de FastVideo ; l'encodeur de texte du modèle de base et les fichiers VAE vidéo/audio se trouvent sur Comfy-Org/MiniMax-H3.
| Composant | Fichier | Emplacement |
|---|---|---|
| Transformer distillé | fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Encodeur de texte | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders/ |
| VAE vidéo | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| VAE audio | minimax_h3_audio_vae_fp32.safetensors | models/vae/ |
Deux modèles officiels
La version 0.11.61 des modèles de Comfy-Org/workflow_templates a ajouté les deux flux de travail le 15 septembre :
- video_fastvideo_fasth3_t2v.json : text-to-video-and-audio. Le nœud
MiniMaxH3ImageToVideos'exécute sans aucune image connectée. - video_fastvideo_fasth3_i2v.json : text-to-video avec conditionnement d'image premier/dernier frame. Connectez
first_frameet/oulast_framepour le fl2va.
La variante premier/dernier frame du modèle FastH3.
Les deux modèles partagent un détail crucial : le checkpoint a été entraîné avec l'attention VSA-H3 à 80 % de sparsité, et les modèles intègrent un nœud BlockSparseAttention réglé sur la méthode vsa avec keep_percent 10 pour reproduire ce motif. Les méthodes sparse sol-attn et sla ne sont pas compatibles avec ce checkpoint. La résolution reste sur la toile native H3 à petit côté de 768px, et la durée s'aligne sur la grille de 17 frames par bloc du modèle à 24 FPS.
Périmètre
Le checkpoint distillé couvre uniquement le text-to-video-and-audio et le conditionnement premier/dernier frame. Ref2VA (conditionnement multi-référence) n'a pas été distillé, les tâches basées sur des références nécessitent donc encore le modèle de base MiniMax H3. Un bonus de cette génération : le chemin RoPE comfy-kitchen de FastVideo signifie que les modèles s'exécutent sur les builds nocturnes standards de ComfyUI, et non sur la pile FastVideo.
Pour situer FastH3 dans le paysage plus large de l'accélération, consultez le classement A/B à l'aveugle de l'H3 Acceleration Arena.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.