FastH3 Trim: урезанная 8-шаговая MiniMax H3 для 8 ГБ GPU
FastVideo выпустила FastH3 Trim: урезанную MiniMax H3 с 42 блоками, которая генерирует 8-шаговое видео со звуком всего на 8 ГБ видеопамяти, с перепакованными файлами для ComfyUI.
Что меняет Trim
Базовая H3 состоит из трёх сетей: текстового энкодера Qwen3-VL, диффузионного трансформера на 50 блоков, который совместно удаляет шум из латентов видео и аудио, и двух VAE. В BF16 это 137,7 ГиБ, что не помещается на карту с 32 ГБ. FastH3 V2 уменьшила размер за счёт квантизации; Trim ещё и удаляет блоки.
Размер чекпоинта по компонентам. BF16 H3 занимает 137,7 ГиБ; релиз FastH3 Trim NVFP4 занимает 33,0 ГиБ, из них трансформер 11,1 ГиБ.
- Прунинг блоков: команда по одному пропускала блоки в базовой H3 и фиксировала, насколько меняются предсказания видео и аудио, по четырём типам примеров (движение, речь, музыка, звуковые события) на трёх уровнях шума, всего 600 измерений. Каждый блок ранжировался по наибольшему изменению, которое он вызывал при любом условии, поэтому сохраняются блоки, важные либо для видео, либо для аудио. Все восемь удалённых блоков находятся в первой половине сети; первый и последний блоки сильнее всего влияли на выход.
- Условие по временным шагам: H3 задаёт для каждого блока условие по диффузионному timestep через проекцию AdaLN, которая отображает 2688-мерный time embedding в шесть векторов модуляции, и в BF16 эти проекции занимают 24 ГиБ на 50 блоков. Trim заменяет их одним общим базисом 2688 → 16 плюс небольшую проекцию для каждого блока, хранимую в FP16, поскольку BF16 даёт примерно в 1,7 раза большую ошибку восстановления.
- Обучение: новая 42-блочная модель обучалась напрямую с восьмишаговым DMD2 по целевой функции FastH3 V2. Базовая H3 инициализирует и замороженного teacher, и обучаемого critic, внимание на 80% разреженное, а шаги сэмплера: 999, 874, 749, 624, 500, 375, 250 и 125.
Трансформер FastH3 Trim в каждом выпускаемом формате, в масштабе: площадь соответствует размеру чекпоинта.
Что входит в перепаковку для ComfyUI
Релиз перепакован для ComfyUI в FastVideo/FastVideo-FastH3-Trim-Comfy. Выберите один файл диффузионной модели и подходящий текстовый энкодер:
| Диффузионная модель | Размер | Где использовать |
|---|---|---|
fastvideo_fasth3_trim_8step_nvfp4.safetensors | 11.9 GB | NVIDIA Blackwell: серия RTX 50, RTX PRO 6000, DGX Spark |
fastvideo_fasth3_trim_8step_fp8.safetensors | 19.7 GB | NVIDIA Ada и новее: серия RTX 40 |
fastvideo_fasth3_trim_8step_int8_convrot.safetensors | 18.9 GB | Любая современная видеокарта NVIDIA; совпадает с настройкой по умолчанию в шаблоне |
fastvideo_fasth3_trim_8step_bf16.safetensors | 37.5 GB | Эталонное качество или конвертация в другие форматы |
В репозитории также есть текстовые энкодеры Qwen3-VL (BF16, INT8 ConvRot, NVFP4 AWQ) и VAE для видео и аудио MiniMax H3. Каждый слой NVFP4 использует шкалы активаций, откалиброванные на 1000 промптов, а в Trim 294 откалиброванных слоя.
Запуск в ComfyUI
Используйте шаблон FastVideo FastH3: Text to Video, поставляемый с ComfyUI (0.36.0 или новее), и выберите одну из диффузионных моделей Trim в его UNETLoader. Сохраните настройки сэмплера из шаблона: 8 шагов, res_multistep, simple и нода MiniMaxH3SigmaShift со значением 10 для видео и 3 для аудио.
Насколько быстро это работает
Время от начала до конца в секундах для 5-секундного клипа со звуком, медиана двух запусков на каждом из двух промптов, по данным из статьи:
| Машина | V2, 480p | Trim, 480p | V2, 768p | Trim, 768p |
|---|---|---|---|---|
| RTX PRO 6000 96 GB | 13.5 | 12.0 | 36.5 | 32.5 |
| RTX 5090 32 GB | 14.8 | 13.4 | 38.6 | 35.4 |
| RTX 4090 24 GB | 54.6 | 43.9 | 154.6 | 132.8 |
| RTX 4090, лимит 16 GB | 79.9 | 72.1 | 153.7 | 139.9 |
| RTX 4090, лимит 12 GB | 91.2 | 74.1 | 170.7 | 147.1 |
| RTX 4090, лимит 8 GB | - | 82.0 | - | - |
| DGX Spark 128 GB, унифицированная память | 141.4 | 125.8 | 340.1 | |
| 2x DGX Spark | 87.2 | 78.3 | ||
| Mac, M4 Max 36 GB, унифицированная память | 925.2 |
Строки с 8 ГБ, 12 ГБ и 16 ГБ относятся к одной и той же RTX 4090 с ограничением видеопамяти; реальная карта с меньшим объёмом памяти будет работать медленнее. В статье отмечено, что на 4090 у пути FP8 нет доступных тензорных ядер FP4, поэтому он обходит более медленный per-token, per-channel FP8 matmul с помощью объединённого per-tensor ядра и масштабирования выхода, а запросы и ключи квантует в INT8 для вычисления score.
Время от начала до конца для 5-секундного клипа 832x480 со звуком, по машинам.
Тот же промпт и seed на RTX 5090: сначала FastH3 V2, затем FastH3 Trim:
FastH3 V2 на RTX 5090.
FastH3 Trim на той же RTX 5090, тот же промпт и seed.
Ограничения
- Trim обозначен как эксперимент, а не лидер по качеству: в статье сказано, что удаление блоков делает модель быстрее и меньше, но стоит некоторого качества, и при приоритете качества рекомендуется FastH3 V2.
- Показатель 8 ГБ относится только к Trim с NVFP4 на карте с ограниченной памятью. V2 не помещается в 12 ГБ в протестированной конфигурации.
- Trim существует только для линейки восьмишагового FastH3. Он не меняет базовую модель MiniMax H3, которой по-прежнему нужен полный 50-блочный трансформер.
- Работа в ComfyUI зависит от шаблона FastH3, поставляемого с ComfyUI 0.36.0 или новее.
Доступность
Перепаковка для ComfyUI: FastVideo/FastVideo-FastH3-Trim-Comfy
Исходные веса: FastVideo/FastVideo-FastH3-Trim-8-Step
Статья в блоге: FastH3 on Consumer Hardware
Код: hao-ai-lab/FastVideo
Аналог с приоритетом качества: FastVideo/FastVideo-FastH3-8-Step-V2
Базовая модель: MiniMaxAI/MiniMax-H3
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.