FastH3 8-Step V2: нативные шаблоны ComfyUI
FastVideo FastH3 8-Step V2 нативно работает в ComfyUI: официальные шаблоны t2v и first/last-frame, настройки BlockSparseAttention VSA и чекпоинт от Comfy-Org.
Когда FastH3 Preview v1 вышел в конце августа, запустить его внутри ComfyUI было нереально: адаптерам VSA требовались собственные лаунчеры FastVideo, и вместо этого мы направляли пользователей ComfyUI к дистилляционным LoRA, таким как H3 Turbo-SLA и PDD Acc LoRA. Теперь всё изменилось. FastVideo выпустил checkpoint 8-Step V2, Comfy-Org перепаковал его для ComfyUI, и официальный репозиторий шаблонов рабочих процессов теперь содержит два нативных шаблона FastH3.
Официальный шаблон FastH3 text-to-video в браузере шаблонов ComfyUI.
Checkpoint 8-Step V2
Модель FastVideo-FastH3-8-Step-V2 представляет собой data-free дистилляцию DMD2 модели MiniMax H3, обученную с вниманием VSA-H3 при разреженности 80%. Она генерирует синхронизированные видео и аудио за 8 прямых проходов трансформера вместо полного расписания базовой модели, и этот выпуск сопровождается важным изменением: README самого checkpoint напрямую документирует требования к вниманию, поэтому его можно запускать вне стека FastVideo, если при выводе воспроизводится паттерн разреженного внимания.
Comfy-Org перепаковал дистиллированный трансформер как fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors в репозитории Comfy-Org/FastVideo-FastH3, который теперь перенаправляет на FastH3-Comfy от FastVideo; текстовый энкодер базовой модели и файлы видео/аудио VAE находятся в Comfy-Org/MiniMax-H3.
| Компонент | Файл | Расположение |
|---|---|---|
| Дистиллированный трансформер | fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| Текстовый энкодер | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | models/text_encoders/ |
| Видео VAE | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| Аудио VAE | minimax_h3_audio_vae_fp32.safetensors | models/vae/ |
Два официальных шаблона
Версия шаблонов 0.11.61 репозитория Comfy-Org/workflow_templates добавила оба рабочих процесса 15 сентября:
- video_fastvideo_fasth3_t2v.json: видео и аудио из текста. Нода
MiniMaxH3ImageToVideoработает без прикреплённых изображений. - video_fastvideo_fasth3_i2v.json: видео из текста плюс условие по изображению первого/последнего кадра. Прикрепите
first_frameи/илиlast_frameдля fl2va.
Вариант шаблона FastH3 с первым/последним кадром.
Оба шаблона объединяет одна важная деталь: checkpoint обучался с вниманием VSA-H3 при разреженности 80%, и в шаблонах используется нода BlockSparseAttention, настроенная на метод vsa с keep_percent 10, чтобы воспроизвести этот паттерн. Разреженные методы sol-attn и sla с этим checkpoint несовместимы. Разрешение остаётся на нативном холсте H3 с короткой стороной 768px, а длительность подстраивается под сетку модели в 17 кадров на блок при 24 FPS.
Область применения
Дистиллированный checkpoint охватывает только генерацию видео и аудио из текста и условие по первому/последнему кадру. Ref2VA (условие по нескольким референсам) не дистиллировался, поэтому задачи на основе референсов по-прежнему требуют базовой модели MiniMax H3. Дополнительный бонус этого поколения: путь RoPE из comfy-kitchen от FastVideo означает, что шаблоны работают на стандартных ночных сборках ComfyUI, а не на стеке FastVideo.
Чтобы понять, какое место FastH3 занимает в общем ландшафте ускорения, смотрите слепой A/B-рейтинг H3 Acceleration Arena.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.