Суперускорение NVIDIA H3: Видео MiniMax H3 до 27.7 раз быстрее

ComfyUI Wikinews

NVIDIA Sol Engine запускает MiniMax H3 как черновик из 4 шагов плюс 3 шага уточнения LTX: 6.85 с для 5-секундного видео 768p, до 27.7 раз быстрее, чем SGLang на одном GB200.

Суперускорение MiniMax H3 (официальная страница) — это pipeline NVIDIA Sol Engine от команды NVIDIA SANA, который превращает генерацию видео MiniMax H3 в двухэтапную задачу: черновик 896×512 за четыре шага от H3 со скоростью LoRA, затем трехшаговый проход уточнения LTX на целевом разрешении с Sol-Attn. Измерено на одном NVIDIA GB200, 5-секундное видео 1344×768 рендерится за 6.85 с, а 10-секундное видео за 14.93 с — на 22.2× и 27.7× быстрее опубликованного базового уровня SGLang.
NVIDIA H3 Super Acceleration: результат толпы города 10 секунд 1440p

Один из самостоятельных результатов 1440p на странице NVIDIA (10 с, 2560×1440): двухэтапное ускорение, для 1440p не было записано сопоставимого базового уровня.

Как это работает

Вместо выполнения множества шагов denoise H3 при полном разрешении, H3 Super Acceleration выполняет большую часть работы по генерации в коротком черновике низкого разрешения, а затем восстанавливает детали высокого разрешения легким проходом уточнения. Каждый этап представляет собой одну задачу, и два этапа выполняются последовательно на одном GB200:

ЭтапМодельРазрешениеFPSШагиВыход
Этап 1 · черновикMiniMax-H3 + скорость LoRA896×512244Черновое видео
Этап 2 · уточнениеLTX-2.5 + Sol-Attn768p / 1080p / 2K243Финальное видео

Этап 1 генерирует исходное видео при 896×512 за четыре denoise шага с помощью LightX2V MiniMax-H3 Turbo LoRA. Этап 2 увеличивает масштаб черновика до требуемого выходного разрешения и выполняет трехшаговый проход Sol-Attn, который восстанавливает детали высокого разрешения и согласованность. Pipeline не является бит-точным по сравнению с базовым уровнем SGLang: он изменяет путь выборки, поэтому различия могут появиться в деталях, текстуре, движении или Аудио; парные видео на странице NVIDIA позволяют вам оценить этот компромисс напрямую.

Измеренная латентность

Конечная латентность на одном NVIDIA GB200, с последними результатами Sol-Super, использующими Sol-Attn для полного сервиса Этапа 2:

РазрешениеДлительностьDiffusersSGLangSol EngineSol-Super E2Eпротив SGLang
1344×7685 с167.8 с152.3 с45.4 с6.852 с22.2×
1344×76810 с468.2 с414.1 с132.5 с14.931 с27.7×

Два ускорения достигаются разными способами. Этап 1 заменяет официальное декодирование VAE H3 (3.427 с) на легкий декодер TAEH3 (0.028 с), а Этап 2 заменяет плотный декодер VAE видео LTX-2.5 (6.404 с при сопоставленном декодировании 121 кадра) на рефинер Sol-Attn и финальный декод LTX TAEHV. Кодер Этапа 2 намеренно оставлен без изменений: рефинер был обучен на оригинальном распределении латентных данных VAE LTX-2.5.

При выходе 768p измеренная пропускная способность составляет примерно 525 пятисекундных видео в час на одном полностью загруженном GB200, против 23.6 с базовым уровнем SGLang.

Визуальное сравнение

Страница NVIDIA сопоставляет каждый образец 768p и 1080p с соответствующим запуском базового уровня SGLang, используя те же входы генерации:

Базовый уровень SGLangH3 Super Acceleration
768p 5 с японская улица, базовый уровень SGLang768p 5 с японская улица, ускорено
Мужчина и женщина обмениваются напряженным замечанием на переполненной японской улице (1344×768, 5 с)Те же входы, на 22.2× быстрее
Базовый уровень SGLangH3 Super Acceleration
1080p 5 с бамбуковый лес, базовый уровень SGLang1080p 5 с бамбуковый лес, ускорено
Два мастера боевых искусств смотрят друг на друга в бамбуковой роще (1080p, 5 с)Те же входы, ускорено

Также были опубликованы два самостоятельных результата 1440p (10 с, 2560×1440) без сопоставимого базового уровня:

Доступность

Pipeline построен из публичных компонентов: официальный чекпоинт MiniMax-H3, четырехшаговая LoRA LightX2V MiniMax-H3 Turbo, используемая для черновика, чекпоинт LTX-2.5 pre-trained, и легкие декодеры TAEH3 и LTX TAEHV. Он работает на NVIDIA Sol Engine с Sol-Attn на оборудовании GB200 и представлен как производственный эталон с измеренными бенчмарками, а не как Пакет Узлов ComfyUI. На момент написания нет официального Рабочего процесса ComfyUI от NVIDIA для этого pipeline; порты Сообщества отдельных компонентов Sol Engine (таких как патчинг Sol-Attn) начали появляться.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Суперускорение NVIDIA H3: Видео MiniMax H3 до 27.7 раз быстрее | ComfyUI Wiki