VDN-H3: видео MiniMax H3 быстрее реального времени

ComfyUI Wikinews

Гибридный checkpoint Video DeltaNet от OpenVDN для MiniMax H3 рендерит клип 768p 14,4 с за 8 шагов. Порт для ComfyUI уже доступен.

VDN-H3 (веса, код): переработанная версия MiniMax H3 с гибридным вниманием от команды UC Berkeley / Impossible, Inc. / UT Austin. В ней квадратичное внимание к длинному контексту заменено линейной ветвью «Video Delta Attention». Релиз включает два дистиллированных чекпойнта: 50-шаговый и 8-шаговый, которые работают поверх немодифицированного бэкбона H3 как патчи. Качество заявлено почти без потерь относительно плотного H3. Нативный порт для ComfyUI уже доступен: Saganaki22/ComfyUI-VDN-H3.
VDN-H3, работающий как нативная нода ComfyUI

Порт сообщества для ComfyUI запускает опубликованные чекпойнты VDN-H3 как рантайм-патчи модели на нативной ноде MiniMax-H3 в ComfyUI, без каких-либо изменений ядра.

Как Video DeltaNet ускоряет H3

В такой фронтирной омнимодели, как MiniMax H3, softmax-внимание к длинным последовательностям токенов занимает более 85% всего времени выполнения, а его стоимость растет квадратично с ростом длины клипа. Video DeltaNet разделяет внимание видео-к-видео на две дополняющие друг друга ветви: двунаправленную softmax-ветвь со скользящим окном, которая сохраняет точное внимание между соседними кадрами (мелкие детали и краткосрочная стабильность), и двунаправленную ветвь линейного внимания, которая переносит контекст большой длины через рекуррентное состояние с постоянной стоимостью. Четырехнаправленная схема граничных якорей добавляет всего 3,57% плотности внимания, сохраняя глобальную согласованность, поэтому первый и последний кадры клипа остаются видимыми для каждого кадра.

Чекпойнт не заменяет бэкбон H3. Он включает отдельную ветвь линейного внимания и два небольших LoRA-адаптера, которые во время вывода объединяются с бэкбоном, не затрагивая оригинальные веса. Помимо изменения архитектуры, 8-шаговая модель представляет собой DMD-дистилляцию 50-шаговой модели.

Производительность и качество

Главные цифры относятся к датацентровой конфигурации: на 8 GPU B200 VDN-H3 генерирует клип 768p длительностью 14,4 секунды за 11,23 секунды при 8 шагах денойзинга. Сравнение на одном GPU с базовым плотным H3:

КонфигурацияGPU50 NFE (VDN-H3, 50 шагов)8 NFE (VDN-H3, 8 шагов)
плотный MiniMax-H3 (H200)127,3 мин4,4 мин
VDN-H3 FP8 (H200)19,4 мин90,5 с
плотный MiniMax-H3 (B200)113,95 мин2,23 мин
VDN-H3 FP8 (B200)15,3 мин51 с

Команда сообщает, что гибридная модель визуально почти неотличима от выхода плотного H3 и показывает более высокое качество и лучшее следование инструкциям, чем MiniMax FastH3. Примеры сравнений, включая ролики бок о бок с плотным H3 и FastH3, есть на странице проекта.

Пример выхода 8-шагового VDN-H3 со страницы проекта.

Запуск в ComfyUI

Официальный релиз рассчитан на датацентровый стек: 8x B200 с параллелизмом последовательностей Ulysses и ядрами FlashAttention-4, которые поддерживают только Hopper и датацентровые Blackwell. Официальных сборок для Windows нет, а потребительские Blackwell (sm_120) не поддерживаются ядрами FA4.

Порт ComfyUI-VDN-H3 воспроизводит математику официального гибридного внимания в виде рантайм-патчей поверх нативной модели MiniMax-H3 в ComfyUI, заменяя FP8-линейные слои и fused-ядра Triton на портируемые эквиваленты PyTorch. Порт покрыт юнит-тестами против официальной реализации и не требует новых зависимостей. Для установки:

  1. Клонируйте репозиторий в ComfyUI/custom_nodes/ и перезапустите ComfyUI.
  2. Скачайте нужную стадию чекпойнта в ComfyUI/models/vdn/, сохранив структуру каталогов в исходном виде (model_spec.json, linear_branch/, adapters/):
hf download OpenVDN/vdn-minimax-h3 --include "stage-dmd-step-250/*" --local-dir <ComfyUI>/models/vdn

Загрузка 8-шаговой стадии stage-dmd-step-250 весит примерно 5 ГБ (линейная ветвь плюс адаптеры), а 50-шаговая стадия stage-b-step-2000 занимает около 4,3 ГБ.

Чего порт не дает, так это заявленной скорости: официальный показатель 74,5x складывается из параллелизма на 8 GPU, FA4, FP8 и 8-шаговой дистилляции. Собственное измерение апстрима на одном GPU составляет около 2,6x при 50 шагах, а портируемые ядра порта оказываются несколько ниже (измерено около 17 с/ит при 1280x736 / 145 кадрах на RTX 5090). Бенчмарки сообщества в каналах Banodoco H3 замерили 8-шаговый VDN-H3 Turbo: 2:04 для 1280x736 против 1:24 у 4-шагового LightXv2 turbo на том же оборудовании. Комментаторы отмечают, что VDN лучше удерживает быстрое движение, чем вариант на базе FastH3.

Тот же промпт с плотным H3 за 50 шагов (верх сравнения на странице проекта).

Доступность

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
VDN-H3: видео MiniMax H3 быстрее реального времени | ComfyUI Wiki