FastH3 Preview v1: 4-шаговая дистилляция MiniMax H3 от FastVideo
FastVideo открыл FastH3 Preview v1: 4-шаговая дистилляция DMD2 MiniMax H3 с разреженным вниманием на 90%, до 14 раз быстрее на GPU Blackwell.
FastVideo совместно с Nuva Lab и командой NVIDIA FastGen открыла исходный код FastH3 Preview v1, 4-шаговую дистиллированную версию MiniMax H3 для генерации текста в видео и аудио (Чекпоинт | Блог | GitHub). Она заменяет 49 вызовов трансформеров базовой модели на 4 и добавляет разреженное внимание на 90%, достигая ускорения до 14 раз на одном GPU NVIDIA Blackwell.
FastH3 Preview v1: MiniMax H3 от FastVideo с открытыми весами, 4-шаговое разреженное дистиллирование
Скорость по результатам бенчмарков
На оборудовании B200 при разрешении 1344x768 и 24 FPS с аудио, рекомендованный чекпоинт VSA / Data-Free генерирует 15-секундный клип за 47.2 секунды на одном B200 (в 14.38 раза быстрее плотной базовой модели) и 15.5 секунд на восьми B200, с 5-секундными и 10-секундными клипами за 16.2с и 31.1с на одном GPU. Тайминги охватывают весь Pipeline: кодирование, Denoising, декодирование, аудио, мультиплексирование и выход файла.
Как работает дистилляция
FastH3 снижает стоимость двумя способами:
- Четыре вызова вместо 49. Distribution Matching Distillation (DMD2) обучает модель-ученика против замороженного учителя Base H3 с обучаемым критиком. Запуски только по промпту используют обратную симуляцию; вариант с синтетическими данными начинается с прямо зашумленных Latents видео и аудио Base-H3.
- Меньше работы внимания на вызов. Модель-ученик использует VSA (обучаемое разреженное внимание для видео Diffusion) с разреженностью 90%, работая на ядре CUDA VSA tile-64 FastVideo с региональной компиляцией DiT, слияниями H3 и скомпилированным видео VAE.
Что входит в релиз
| Элемент | Репозиторий | Примечания |
|---|---|---|
| Полный Чекпоинт | FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree | Рекомендуемый Preview v1, требует бэкенд внимания VSA-H3 |
| Предварительно извлеченный LoRA | FastVideo-FastH3-4-step-Preview-v1-LoRA | Включает адаптер VSA-datafree плюс абляции плотных и синтетических данных |
| Код вывода | hao-ai-lab/FastVideo | Дополнительный модуль fasth3 с опубликованными колесами ядра CUDA; код обучения Скоро будет |
Чекпойнты обучены и проверены на нескольких соотношениях сторон, включая квадратное, портретное, ландшафтное и ультраширокое 768p, с пользовательской высотой и шириной в кратных 32 значениях. Они повторно используют текстовый энкодер H3-Base, видео VAE, аудио VAE, Tokenizers и Schedulers.
Область применения и доступность в ComfyUI
Preview v1 охватывает только текст в видео и аудио: FL2VA (условие изображения первого кадра) и Ref2VA (условие изображения-ссылки) не были дистиллированы, и сложное движение, мелкие детали и некоторые аудио могут уступать базовой модели. FastVideo перечисляет поддержку ссылки на изображение, квантование NVFP4, оптимизации RTX / DGX Spark / Apple MLX и новые запуски с методом PDD NVIDIA в дорожной карте.
Для пользователей ComfyUI сегодня FastH3 является релизом стека FastVideo, а не чекпоинтом для вставки: адаптеры VSA требуют бэкенда и лаунчеров VSA-H3 FastVideo, а не универсального загрузчика LoRA. Нативное ускорение ComfyUI для H3 сейчас поступает от дистилляционных LoRA, таких как H3 Turbo-SLA и PDD Acc LoRA, которые работают на стандартных рабочих процессах ComfyUI H3. Путь совместимости FastH3 с ComfyUI стоит наблюдать, поскольку Команда приносит Модели на потребительское оборудование.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.