FastH3 Preview v1: 4-шаговая дистилляция MiniMax H3 от FastVideo

ComfyUI Wikinews

FastVideo открыл FastH3 Preview v1: 4-шаговая дистилляция DMD2 MiniMax H3 с разреженным вниманием на 90%, до 14 раз быстрее на GPU Blackwell.

FastVideo совместно с Nuva Lab и командой NVIDIA FastGen открыла исходный код FastH3 Preview v1, 4-шаговую дистиллированную версию MiniMax H3 для генерации текста в видео и аудио (Чекпоинт | Блог | GitHub). Она заменяет 49 вызовов трансформеров базовой модели на 4 и добавляет разреженное внимание на 90%, достигая ускорения до 14 раз на одном GPU NVIDIA Blackwell.

FastH3 Preview v1

FastH3 Preview v1: MiniMax H3 от FastVideo с открытыми весами, 4-шаговое разреженное дистиллирование

Скорость по результатам бенчмарков

На оборудовании B200 при разрешении 1344x768 и 24 FPS с аудио, рекомендованный чекпоинт VSA / Data-Free генерирует 15-секундный клип за 47.2 секунды на одном B200 (в 14.38 раза быстрее плотной базовой модели) и 15.5 секунд на восьми B200, с 5-секундными и 10-секундными клипами за 16.2с и 31.1с на одном GPU. Тайминги охватывают весь Pipeline: кодирование, Denoising, декодирование, аудио, мультиплексирование и выход файла.

Как работает дистилляция

FastH3 снижает стоимость двумя способами:

  • Четыре вызова вместо 49. Distribution Matching Distillation (DMD2) обучает модель-ученика против замороженного учителя Base H3 с обучаемым критиком. Запуски только по промпту используют обратную симуляцию; вариант с синтетическими данными начинается с прямо зашумленных Latents видео и аудио Base-H3.
  • Меньше работы внимания на вызов. Модель-ученик использует VSA (обучаемое разреженное внимание для видео Diffusion) с разреженностью 90%, работая на ядре CUDA VSA tile-64 FastVideo с региональной компиляцией DiT, слияниями H3 и скомпилированным видео VAE.

Что входит в релиз

ЭлементРепозиторийПримечания
Полный ЧекпоинтFastVideo-FastH3-4-step-Preview-v1-VSA-DataFreeРекомендуемый Preview v1, требует бэкенд внимания VSA-H3
Предварительно извлеченный LoRAFastVideo-FastH3-4-step-Preview-v1-LoRAВключает адаптер VSA-datafree плюс абляции плотных и синтетических данных
Код выводаhao-ai-lab/FastVideoДополнительный модуль fasth3 с опубликованными колесами ядра CUDA; код обучения Скоро будет

Чекпойнты обучены и проверены на нескольких соотношениях сторон, включая квадратное, портретное, ландшафтное и ультраширокое 768p, с пользовательской высотой и шириной в кратных 32 значениях. Они повторно используют текстовый энкодер H3-Base, видео VAE, аудио VAE, Tokenizers и Schedulers.

Область применения и доступность в ComfyUI

Preview v1 охватывает только текст в видео и аудио: FL2VA (условие изображения первого кадра) и Ref2VA (условие изображения-ссылки) не были дистиллированы, и сложное движение, мелкие детали и некоторые аудио могут уступать базовой модели. FastVideo перечисляет поддержку ссылки на изображение, квантование NVFP4, оптимизации RTX / DGX Spark / Apple MLX и новые запуски с методом PDD NVIDIA в дорожной карте.

Для пользователей ComfyUI сегодня FastH3 является релизом стека FastVideo, а не чекпоинтом для вставки: адаптеры VSA требуют бэкенда и лаунчеров VSA-H3 FastVideo, а не универсального загрузчика LoRA. Нативное ускорение ComfyUI для H3 сейчас поступает от дистилляционных LoRA, таких как H3 Turbo-SLA и PDD Acc LoRA, которые работают на стандартных рабочих процессах ComfyUI H3. Путь совместимости FastH3 с ComfyUI стоит наблюдать, поскольку Команда приносит Модели на потребительское оборудование.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
FastH3 Preview v1: 4-шаговая дистилляция MiniMax H3 от FastVideo | ComfyUI Wiki