Суперускорение NVIDIA H3: Видео MiniMax H3 до 27.7 раз быстрее
NVIDIA Sol Engine запускает MiniMax H3 как черновик из 4 шагов плюс 3 шага уточнения LTX: 6.85 с для 5-секундного видео 768p, до 27.7 раз быстрее, чем SGLang на одном GB200.
Один из самостоятельных результатов 1440p на странице NVIDIA (10 с, 2560×1440): двухэтапное ускорение, для 1440p не было записано сопоставимого базового уровня.
Как это работает
Вместо выполнения множества шагов denoise H3 при полном разрешении, H3 Super Acceleration выполняет большую часть работы по генерации в коротком черновике низкого разрешения, а затем восстанавливает детали высокого разрешения легким проходом уточнения. Каждый этап представляет собой одну задачу, и два этапа выполняются последовательно на одном GB200:
| Этап | Модель | Разрешение | FPS | Шаги | Выход |
|---|---|---|---|---|---|
| Этап 1 · черновик | MiniMax-H3 + скорость LoRA | 896×512 | 24 | 4 | Черновое видео |
| Этап 2 · уточнение | LTX-2.5 + Sol-Attn | 768p / 1080p / 2K | 24 | 3 | Финальное видео |
Этап 1 генерирует исходное видео при 896×512 за четыре denoise шага с помощью LightX2V MiniMax-H3 Turbo LoRA. Этап 2 увеличивает масштаб черновика до требуемого выходного разрешения и выполняет трехшаговый проход Sol-Attn, который восстанавливает детали высокого разрешения и согласованность. Pipeline не является бит-точным по сравнению с базовым уровнем SGLang: он изменяет путь выборки, поэтому различия могут появиться в деталях, текстуре, движении или Аудио; парные видео на странице NVIDIA позволяют вам оценить этот компромисс напрямую.
Измеренная латентность
Конечная латентность на одном NVIDIA GB200, с последними результатами Sol-Super, использующими Sol-Attn для полного сервиса Этапа 2:
| Разрешение | Длительность | Diffusers | SGLang | Sol Engine | Sol-Super E2E | против SGLang |
|---|---|---|---|---|---|---|
| 1344×768 | 5 с | 167.8 с | 152.3 с | 45.4 с | 6.852 с | 22.2× |
| 1344×768 | 10 с | 468.2 с | 414.1 с | 132.5 с | 14.931 с | 27.7× |
Два ускорения достигаются разными способами. Этап 1 заменяет официальное декодирование VAE H3 (3.427 с) на легкий декодер TAEH3 (0.028 с), а Этап 2 заменяет плотный декодер VAE видео LTX-2.5 (6.404 с при сопоставленном декодировании 121 кадра) на рефинер Sol-Attn и финальный декод LTX TAEHV. Кодер Этапа 2 намеренно оставлен без изменений: рефинер был обучен на оригинальном распределении латентных данных VAE LTX-2.5.
При выходе 768p измеренная пропускная способность составляет примерно 525 пятисекундных видео в час на одном полностью загруженном GB200, против 23.6 с базовым уровнем SGLang.
Визуальное сравнение
Страница NVIDIA сопоставляет каждый образец 768p и 1080p с соответствующим запуском базового уровня SGLang, используя те же входы генерации:
| Базовый уровень SGLang | H3 Super Acceleration |
|---|---|
![]() | ![]() |
| Мужчина и женщина обмениваются напряженным замечанием на переполненной японской улице (1344×768, 5 с) | Те же входы, на 22.2× быстрее |
| Базовый уровень SGLang | H3 Super Acceleration |
|---|---|
![]() | ![]() |
| Два мастера боевых искусств смотрят друг на друга в бамбуковой роще (1080p, 5 с) | Те же входы, ускорено |
Также были опубликованы два самостоятельных результата 1440p (10 с, 2560×1440) без сопоставимого базового уровня:
Доступность
Pipeline построен из публичных компонентов: официальный чекпоинт MiniMax-H3, четырехшаговая LoRA LightX2V MiniMax-H3 Turbo, используемая для черновика, чекпоинт LTX-2.5 pre-trained, и легкие декодеры TAEH3 и LTX TAEHV. Он работает на NVIDIA Sol Engine с Sol-Attn на оборудовании GB200 и представлен как производственный эталон с измеренными бенчмарками, а не как Пакет Узлов ComfyUI. На момент написания нет официального Рабочего процесса ComfyUI от NVIDIA для этого pipeline; порты Сообщества отдельных компонентов Sol Engine (таких как патчинг Sol-Attn) начали появляться.




Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.