FastH3 Trim: урезанная 8-шаговая MiniMax H3 для 8 ГБ GPU

ComfyUI Wikinews

FastVideo выпустила FastH3 Trim: урезанную MiniMax H3 с 42 блоками, которая генерирует 8-шаговое видео со звуком всего на 8 ГБ видеопамяти, с перепакованными файлами для ComfyUI.

FastH3 Trim: экспериментальный вариант FastH3 V2 от FastVideo из Hao AI Lab: та же восьмишаговая дистилляция MiniMax H3 с синхронизацией аудио, но с удалёнными 8 из 50 блоков трансформера. Она в 4,2 раза меньше базовой H3 и, по данным команды, быстрее V2 на каждом протестированном устройстве, вплоть до RTX 4090 с ограничением памяти в 8 ГБ. Веса и перепаковка для ComfyUI появились на Hugging Face с 3 по 6 октября, а 6 октября команда опубликовала статью FastH3 on Consumer Hardware.
FastH3 на потребительском железе

Что меняет Trim

Базовая H3 состоит из трёх сетей: текстового энкодера Qwen3-VL, диффузионного трансформера на 50 блоков, который совместно удаляет шум из латентов видео и аудио, и двух VAE. В BF16 это 137,7 ГиБ, что не помещается на карту с 32 ГБ. FastH3 V2 уменьшила размер за счёт квантизации; Trim ещё и удаляет блоки.

Размер чекпоинта по компонентам

Размер чекпоинта по компонентам. BF16 H3 занимает 137,7 ГиБ; релиз FastH3 Trim NVFP4 занимает 33,0 ГиБ, из них трансформер 11,1 ГиБ.

  • Прунинг блоков: команда по одному пропускала блоки в базовой H3 и фиксировала, насколько меняются предсказания видео и аудио, по четырём типам примеров (движение, речь, музыка, звуковые события) на трёх уровнях шума, всего 600 измерений. Каждый блок ранжировался по наибольшему изменению, которое он вызывал при любом условии, поэтому сохраняются блоки, важные либо для видео, либо для аудио. Все восемь удалённых блоков находятся в первой половине сети; первый и последний блоки сильнее всего влияли на выход.
  • Условие по временным шагам: H3 задаёт для каждого блока условие по диффузионному timestep через проекцию AdaLN, которая отображает 2688-мерный time embedding в шесть векторов модуляции, и в BF16 эти проекции занимают 24 ГиБ на 50 блоков. Trim заменяет их одним общим базисом 2688 → 16 плюс небольшую проекцию для каждого блока, хранимую в FP16, поскольку BF16 даёт примерно в 1,7 раза большую ошибку восстановления.
  • Обучение: новая 42-блочная модель обучалась напрямую с восьмишаговым DMD2 по целевой функции FastH3 V2. Базовая H3 инициализирует и замороженного teacher, и обучаемого critic, внимание на 80% разреженное, а шаги сэмплера: 999, 874, 749, 624, 500, 375, 250 и 125.
Размер трансформера FastH3 Trim по форматам

Трансформер FastH3 Trim в каждом выпускаемом формате, в масштабе: площадь соответствует размеру чекпоинта.

Что входит в перепаковку для ComfyUI

Релиз перепакован для ComfyUI в FastVideo/FastVideo-FastH3-Trim-Comfy. Выберите один файл диффузионной модели и подходящий текстовый энкодер:

Диффузионная модельРазмерГде использовать
fastvideo_fasth3_trim_8step_nvfp4.safetensors11.9 GBNVIDIA Blackwell: серия RTX 50, RTX PRO 6000, DGX Spark
fastvideo_fasth3_trim_8step_fp8.safetensors19.7 GBNVIDIA Ada и новее: серия RTX 40
fastvideo_fasth3_trim_8step_int8_convrot.safetensors18.9 GBЛюбая современная видеокарта NVIDIA; совпадает с настройкой по умолчанию в шаблоне
fastvideo_fasth3_trim_8step_bf16.safetensors37.5 GBЭталонное качество или конвертация в другие форматы

В репозитории также есть текстовые энкодеры Qwen3-VL (BF16, INT8 ConvRot, NVFP4 AWQ) и VAE для видео и аудио MiniMax H3. Каждый слой NVFP4 использует шкалы активаций, откалиброванные на 1000 промптов, а в Trim 294 откалиброванных слоя.

Запуск в ComfyUI

Используйте шаблон FastVideo FastH3: Text to Video, поставляемый с ComfyUI (0.36.0 или новее), и выберите одну из диффузионных моделей Trim в его UNETLoader. Сохраните настройки сэмплера из шаблона: 8 шагов, res_multistep, simple и нода MiniMaxH3SigmaShift со значением 10 для видео и 3 для аудио.

Насколько быстро это работает

Время от начала до конца в секундах для 5-секундного клипа со звуком, медиана двух запусков на каждом из двух промптов, по данным из статьи:

МашинаV2, 480pTrim, 480pV2, 768pTrim, 768p
RTX PRO 6000 96 GB13.512.036.532.5
RTX 5090 32 GB14.813.438.635.4
RTX 4090 24 GB54.643.9154.6132.8
RTX 4090, лимит 16 GB79.972.1153.7139.9
RTX 4090, лимит 12 GB91.274.1170.7147.1
RTX 4090, лимит 8 GB-82.0--
DGX Spark 128 GB, унифицированная память141.4125.8340.1
2x DGX Spark87.278.3
Mac, M4 Max 36 GB, унифицированная память925.2

Строки с 8 ГБ, 12 ГБ и 16 ГБ относятся к одной и той же RTX 4090 с ограничением видеопамяти; реальная карта с меньшим объёмом памяти будет работать медленнее. В статье отмечено, что на 4090 у пути FP8 нет доступных тензорных ядер FP4, поэтому он обходит более медленный per-token, per-channel FP8 matmul с помощью объединённого per-tensor ядра и масштабирования выхода, а запросы и ключи квантует в INT8 для вычисления score.

Время работы от начала до конца по машинам

Время от начала до конца для 5-секундного клипа 832x480 со звуком, по машинам.

Тот же промпт и seed на RTX 5090: сначала FastH3 V2, затем FastH3 Trim:

FastH3 V2 на RTX 5090.

FastH3 Trim на той же RTX 5090, тот же промпт и seed.

Ограничения

  • Trim обозначен как эксперимент, а не лидер по качеству: в статье сказано, что удаление блоков делает модель быстрее и меньше, но стоит некоторого качества, и при приоритете качества рекомендуется FastH3 V2.
  • Показатель 8 ГБ относится только к Trim с NVFP4 на карте с ограниченной памятью. V2 не помещается в 12 ГБ в протестированной конфигурации.
  • Trim существует только для линейки восьмишагового FastH3. Он не меняет базовую модель MiniMax H3, которой по-прежнему нужен полный 50-блочный трансформер.
  • Работа в ComfyUI зависит от шаблона FastH3, поставляемого с ComfyUI 0.36.0 или новее.

Доступность

Перепаковка для ComfyUI: FastVideo/FastVideo-FastH3-Trim-Comfy
Исходные веса: FastVideo/FastVideo-FastH3-Trim-8-Step
Статья в блоге: FastH3 on Consumer Hardware
Код: hao-ai-lab/FastVideo
Аналог с приоритетом качества: FastVideo/FastVideo-FastH3-8-Step-V2
Базовая модель: MiniMaxAI/MiniMax-H3

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
FastH3 Trim: урезанная 8-шаговая MiniMax H3 для 8 ГБ GPU | ComfyUI Wiki