FastH3 8-Step V2 : des modèles ComfyUI natifs officiels

ComfyUI Wikinews

FastVideo FastH3 8-Step V2 natif dans ComfyUI : modèles t2v et premier/dernier frame, réglages VSA BlockSparseAttention et checkpoint de Comfy-Org.

Lors du lancement de FastH3 Preview v1 fin août, l'exécuter dans ComfyUI n'était pas réaliste : les adaptateurs VSA nécessitaient les lanceurs propres à FastVideo, et nous orientions plutôt les utilisateurs de ComfyUI vers des LoRA de distillation comme H3 Turbo-SLA et PDD Acc LoRA. La situation a changé. FastVideo a publié un checkpoint 8-Step V2, Comfy-Org l'a repackagé pour ComfyUI, et le dépôt officiel de modèles de flux de travail contient désormais deux modèles FastH3 natifs.

Aperçu du modèle FastH3 t2v

Le modèle officiel text-to-video FastH3 dans le navigateur de modèles de ComfyUI.

Le checkpoint 8-Step V2

FastVideo-FastH3-8-Step-V2 est une distillation DMD2 sans données de MiniMax H3, entraînée avec l'attention VSA-H3 à 80 % de sparsité. Il génère de la vidéo et de l'audio synchronisés en 8 passes forward du transformer au lieu du calendrier complet du modèle de base, et cette génération arrive avec un changement permissif : le README du checkpoint documente directement les exigences d'attention, il peut donc être servi en dehors de la pile FastVideo tant que le motif d'attention sparse est reproduit à l'inférence.

Comfy-Org a repackagé le transformer distillé sous le nom fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors dans le dépôt Comfy-Org/FastVideo-FastH3, qui redirige désormais vers FastH3-Comfy de FastVideo ; l'encodeur de texte du modèle de base et les fichiers VAE vidéo/audio se trouvent sur Comfy-Org/MiniMax-H3.

ComposantFichierEmplacement
Transformer distilléfastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensorsmodels/diffusion_models/
Encodeur de texteqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsmodels/text_encoders/
VAE vidéominimax_h3_video_vae_fp16.safetensorsmodels/vae/
VAE audiominimax_h3_audio_vae_fp32.safetensorsmodels/vae/

Deux modèles officiels

La version 0.11.61 des modèles de Comfy-Org/workflow_templates a ajouté les deux flux de travail le 15 septembre :

Aperçu du modèle FastH3 i2v

La variante premier/dernier frame du modèle FastH3.

Les deux modèles partagent un détail crucial : le checkpoint a été entraîné avec l'attention VSA-H3 à 80 % de sparsité, et les modèles intègrent un nœud BlockSparseAttention réglé sur la méthode vsa avec keep_percent 10 pour reproduire ce motif. Les méthodes sparse sol-attn et sla ne sont pas compatibles avec ce checkpoint. La résolution reste sur la toile native H3 à petit côté de 768px, et la durée s'aligne sur la grille de 17 frames par bloc du modèle à 24 FPS.

Périmètre

Le checkpoint distillé couvre uniquement le text-to-video-and-audio et le conditionnement premier/dernier frame. Ref2VA (conditionnement multi-référence) n'a pas été distillé, les tâches basées sur des références nécessitent donc encore le modèle de base MiniMax H3. Un bonus de cette génération : le chemin RoPE comfy-kitchen de FastVideo signifie que les modèles s'exécutent sur les builds nocturnes standards de ComfyUI, et non sur la pile FastVideo.

Pour situer FastH3 dans le paysage plus large de l'accélération, consultez le classement A/B à l'aveugle de l'H3 Acceleration Arena.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
FastH3 8-Step V2 : des modèles ComfyUI natifs officiels | ComfyUI Wiki