FastH3 8-Step V2: нативные шаблоны ComfyUI

ComfyUI Wikinews

FastVideo FastH3 8-Step V2 нативно работает в ComfyUI: официальные шаблоны t2v и first/last-frame, настройки BlockSparseAttention VSA и чекпоинт от Comfy-Org.

Когда FastH3 Preview v1 вышел в конце августа, запустить его внутри ComfyUI было нереально: адаптерам VSA требовались собственные лаунчеры FastVideo, и вместо этого мы направляли пользователей ComfyUI к дистилляционным LoRA, таким как H3 Turbo-SLA и PDD Acc LoRA. Теперь всё изменилось. FastVideo выпустил checkpoint 8-Step V2, Comfy-Org перепаковал его для ComfyUI, и официальный репозиторий шаблонов рабочих процессов теперь содержит два нативных шаблона FastH3.

Предпросмотр шаблона FastH3 t2v

Официальный шаблон FastH3 text-to-video в браузере шаблонов ComfyUI.

Checkpoint 8-Step V2

Модель FastVideo-FastH3-8-Step-V2 представляет собой data-free дистилляцию DMD2 модели MiniMax H3, обученную с вниманием VSA-H3 при разреженности 80%. Она генерирует синхронизированные видео и аудио за 8 прямых проходов трансформера вместо полного расписания базовой модели, и этот выпуск сопровождается важным изменением: README самого checkpoint напрямую документирует требования к вниманию, поэтому его можно запускать вне стека FastVideo, если при выводе воспроизводится паттерн разреженного внимания.

Comfy-Org перепаковал дистиллированный трансформер как fastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensors в репозитории Comfy-Org/FastVideo-FastH3, который теперь перенаправляет на FastH3-Comfy от FastVideo; текстовый энкодер базовой модели и файлы видео/аудио VAE находятся в Comfy-Org/MiniMax-H3.

КомпонентФайлРасположение
Дистиллированный трансформерfastvideo_fasth3_8step_v2_pruned_int8_convrot.safetensorsmodels/diffusion_models/
Текстовый энкодерqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsmodels/text_encoders/
Видео VAEminimax_h3_video_vae_fp16.safetensorsmodels/vae/
Аудио VAEminimax_h3_audio_vae_fp32.safetensorsmodels/vae/

Два официальных шаблона

Версия шаблонов 0.11.61 репозитория Comfy-Org/workflow_templates добавила оба рабочих процесса 15 сентября:

  • video_fastvideo_fasth3_t2v.json: видео и аудио из текста. Нода MiniMaxH3ImageToVideo работает без прикреплённых изображений.
  • video_fastvideo_fasth3_i2v.json: видео из текста плюс условие по изображению первого/последнего кадра. Прикрепите first_frame и/или last_frame для fl2va.
Предпросмотр шаблона FastH3 i2v

Вариант шаблона FastH3 с первым/последним кадром.

Оба шаблона объединяет одна важная деталь: checkpoint обучался с вниманием VSA-H3 при разреженности 80%, и в шаблонах используется нода BlockSparseAttention, настроенная на метод vsa с keep_percent 10, чтобы воспроизвести этот паттерн. Разреженные методы sol-attn и sla с этим checkpoint несовместимы. Разрешение остаётся на нативном холсте H3 с короткой стороной 768px, а длительность подстраивается под сетку модели в 17 кадров на блок при 24 FPS.

Область применения

Дистиллированный checkpoint охватывает только генерацию видео и аудио из текста и условие по первому/последнему кадру. Ref2VA (условие по нескольким референсам) не дистиллировался, поэтому задачи на основе референсов по-прежнему требуют базовой модели MiniMax H3. Дополнительный бонус этого поколения: путь RoPE из comfy-kitchen от FastVideo означает, что шаблоны работают на стандартных ночных сборках ComfyUI, а не на стеке FastVideo.

Чтобы понять, какое место FastH3 занимает в общем ландшафте ускорения, смотрите слепой A/B-рейтинг H3 Acceleration Arena.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
FastH3 8-Step V2: нативные шаблоны ComfyUI | ComfyUI Wiki