FastH3 8-Step V2 ya tiene plantillas nativas para ComfyUI
FastVideo FastH3 8-Step V2 nativo en ComfyUI: plantillas oficiales t2v y primer/último fotograma, VSA de BlockSparseAttention y checkpoint de Comfy-Org.
Cuando se lanzó FastH3 Preview v1 a finales de agosto, ejecutarlo dentro de ComfyUI no era realista: los adaptadores VSA necesitaban los lanzadores propios de FastVideo, y en su lugar dirigíamos a los usuarios de ComfyUI a LoRA de destilación como H3 Turbo-SLA y PDD Acc LoRA. Eso ha cambiado. FastVideo publicó un checkpoint 8-Step V2, Comfy-Org lo reempaquetó para ComfyUI y el repositorio oficial de plantillas de flujos de trabajo ahora incluye dos plantillas nativas de FastH3.
La plantilla oficial de texto a vídeo de FastH3 en el navegador de plantillas de ComfyUI.
El checkpoint 8-Step V2
FastVideo-FastH3-8-Step-V2 es una destilación DMD2 sin datos de MiniMax H3, entrenada con atención VSA-H3 con un 80 % de dispersión. Genera vídeo y audio sincronizados en 8 pasadas del transformer en lugar del esquema completo del modelo base, y esta generación llega con un cambio permisivo: el propio README del checkpoint documenta directamente los requisitos de atención, por lo que puede servirse fuera del stack de FastVideo siempre que el patrón de atención dispersa se reproduzca en inferencia.
Comfy-Org reempaquetó el transformer destilado como fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors en el repositorio Comfy-Org/FastVideo-FastH3, que ahora redirige a FastH3-Comfy de FastVideo; el codificador de texto del modelo base y los archivos del VAE de vídeo y audio están en Comfy-Org/MiniMax-H3.
| Componente | Archivo | Ubicación |
|---|---|---|
| Transformer destilado | fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Codificador de texto | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders/ |
| VAE de vídeo | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| VAE de audio | minimax_h3_audio_vae_fp32.safetensors | models/vae/ |
Dos plantillas oficiales
La versión 0.11.61 de las plantillas de Comfy-Org/workflow_templates añadió ambos flujos de trabajo el 15 de septiembre:
- video_fastvideo_fasth3_t2v.json: texto a vídeo y audio. El nodo
MiniMaxH3ImageToVideose ejecuta sin ninguna imagen conectada. - video_fastvideo_fasth3_i2v.json: texto a vídeo más acondicionamiento por imágenes de primer/último fotograma. Conecta
first_framey/olast_framepara fl2va.
La variante de primer/último fotograma de la plantilla de FastH3.
Ambas plantillas comparten un detalle crítico: el checkpoint se entrenó con atención VSA-H3 con un 80 % de dispersión, y las plantillas incorporan un nodo BlockSparseAttention configurado con el método vsa y keep_percent 10 para reproducir ese patrón. Los métodos dispersos sol-attn y sla no son compatibles con este checkpoint. La resolución se mantiene en el lienzo nativo de 768px de borde corto de H3, y la duración se ajusta a la cuadrícula de 17 fotogramas por bloque del modelo a 24 FPS.
Alcance
El checkpoint destilado cubre únicamente texto a vídeo y audio, y acondicionamiento de primer/último fotograma. Ref2VA (acondicionamiento con múltiples referencias) no se destiló, por lo que las tareas basadas en referencias siguen necesitando el modelo base MiniMax H3. Una ventaja adicional de esta generación: la ruta RoPE de comfy-kitchen de FastVideo hace que las plantillas funcionen en compilaciones nocturnas estándar de ComfyUI, no en el stack de FastVideo.
Para poner en contexto el lugar que ocupa FastH3 en el panorama más amplio de la aceleración, consulta la clasificación A/B a ciegas de H3 Acceleration Arena.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.