Veda Sparse Attention в ComfyUI: ускорение MiniMax H3
Команда Veda выпустила официальный узел ComfyUI, который заменяет внимание MiniMax H3 дистиллированным разреженным предиктором и пропускает 90% внимания, ускоряя видео до 3 раз.
Со страницы проекта Veda: Waver-T2V-12B при 720p, 241 кадр. Слева полное внимание, справа путь Veda с пропуском тайлов.
Что делает Veda
Вместо сжатия или переобучения модели Veda определяет, какие части карты внимания важны. Дистиллированный лёгкий предиктор оценивает тайлы внимания и оставляет примерно топ-10%, а ядро с пропуском тайлов выбирает только отобранные тайлы K/V. Поскольку метод меняет способ вычисления внимания, а не сами веса, он остаётся совместим с любыми LoRA и с дообученными или квантованными чекпойнтами MiniMax H3.
Страница проекта описывает метод в три этапа: полное внимание с max-пулингом формирует учительское распределение на уровне тайлов, оценщик Triplet Pooling с проекциями Q/K для каждой головы восстанавливает это распределение, а выбор top-k с учётом голов формирует маску тайлов, которой следует ядро. Геометрия тайлов для каждого слоя и каждой головы подбирается так, чтобы разнородные пространственные и временные головы укладывались в фиксированный бюджет оборудования.
Для MiniMax H3 выпущенный предиктор обучен с 8-шаговой Turbo LoRA. В репозитории отмечено, что чекпойнт не зависит от модальности и числа шагов: он применим к T2VA, FL2VA и R2VA при любом числе шагов выборки, а отдельный fine-tune для R2VA анонсирован в будущем релизе.
Узел ComfyUI
Узел намеренно минималистичен: MODEL на входе, MODEL на выходе. Он устанавливается как переопределение внимания, поэтому подключается к линии MODEL после модели и любых загрузчиков LoRA и непосредственно перед ГИДом или СЭМПЛЕРом. Обход узла через Ctrl+B отрендерит тот же seed с полным вниманием для прямого сравнения.
| Вход | По умолчанию | Описание |
|---|---|---|
generated_sparsity | 90% | Разреженность внимания сгенерированного видео. Целое число, например 24, сохраняет ровно столько тайлов ключей по 128 токенов. |
reference_sparsity | 90% | То же для референсных токенов: первого и последнего кадров, управляющих кадров, референсных изображений и видео. 0% даёт им полное внимание. |
full_attention_layers | пусто | Блоки DiT с нумерацией от 0, сохраняющие полное внимание, например 0, 1, 47-49. |
full_attention_steps | пусто | Шаги выборки с нумерацией от 0, сохраняющие полное внимание. |
verbose | выкл. | Выводить тайминги внимания по фазам, число вызовов и детали предиктора после каждого запуска. |
После запуска узел выводит, что он фактически сделал:
Veda done · Triton INT8 (SM120)
Video: 1344x768 · 5.2 s
Attention computed: 10.9% of full attention (89.1% skipped)Если ядро не может выполниться на текущем GPU, узел сообщает об этом, и модель для этого запуска использует собственное внимание вместо того, чтобы выдать испорченный рендер.
Производительность
T2VA при 1344x768, 124 кадра (5,2 с), 8-шаговая Turbo LoRA и разреженность 90%, замерено на RTX 5070 12 ГБ под Windows 11:
| Путь внимания | На шаг | 8 шагов | Внимание на шаг |
|---|---|---|---|
| ComfyUI по умолчанию | 40,7 с | 342 с | 31,1 с |
ComfyUI --use-sage-attention | 24,8 с | 231 с | 15,2 с |
| Veda sparse INT8 | 14,0 с | 130 с | 4,41 с |
Это примерно в 2,9 раза быстрее от начала до конца и в 7,1 раза быстрее по одному вниманию, причём разрыв растёт с длиной клипа. Один слой внимания при 104 тыс. токенов с разреженностью 90% занимает 528 мс против 11,8 с для полного внимания.
Veda при разреженности 95%. Проект Veda сообщает об ускорении в 5,1 раза от начала до конца на Waver-T2V-12B при 720p и 241 кадре: с 19,4 минуты до 3,8 минуты.
Репозиторий предиктора приводит ускорение от начала до конца относительно собственного базового полного внимания, всё при сохранении 10% внимания с Turbo LoRA:
| GPU | Клип | Ускорение внимания | Ускорение от начала до конца |
|---|---|---|---|
| RTX PRO 6000 Blackwell | 16:9 · 14,4 с | 6,79x | 3,12x |
| RTX 4090 | 16:9 · 5,17 с | 4,75x | 1,77x |
| RTX 4090 | 16:9 · 10,1 с | 6,22x | 2,42x |
| RTX 4090 | 16:9 · 14,4 с | 6,31x | 2,82x |
Слева полное внимание, справа Veda: одинаковый промпт, seed и Turbo LoRA, сгенерировано на одной RTX PRO 6000 Blackwell.
Поддержка оборудования
Одно ядро Triton охватывает все GPU NVIDIA начиная с SM80 под Windows и Linux, а Apple silicon работает через MLX. Для карт без подходящего ядра узел сообщает об этом, и модель сохраняет собственное внимание.
| Оборудование | Статус |
|---|---|
| RTX 30 / A100 / RTX 40 / L40 (sm80-89) | путь кода готов, авторы пока не проверяли |
| H100 / H200 (sm90) | путь кода готов, авторы пока не проверяли |
| B200 / B300 (sm100 / sm103) | путь кода готов, авторы пока не проверяли |
| RTX 50, RTX PRO 6000 Blackwell (sm120) | проверено: RTX 5070, Windows 11 |
| DGX Spark / GB10 (sm121) | путь кода готов, авторы пока не проверяли |
| Apple silicon (M series) | проверено: M3 Pro, macOS 15 |
Начало работы
Veda требует ComfyUI 0.38.0 или новее. Установите узел через Менеджер ComfyUI, найдя «Veda», или из CLI:
comfy node install veda-sparse-attentionЗатем поместите предиктор размером 275 МБ в ComfyUI/models/veda/:
hf download Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview \
minimax_h3_t2va_veda_8nfe_600step_preview_fp8.safetensors \
--local-dir ComfyUI/models/vedaУзел ничего не скачивает сам. Проще открыть Рабочий процесс -> Просмотреть шаблоны -> Veda-on-ComfyUI и выбрать шаблон: он предложит предиктор в диалоге отсутствующих моделей ComfyUI. В репозитории есть два примера рабочих процессов:
Доступность
Узел доступен в Comfy Registry как veda-sparse-attention, исходный код: veda-sparse/Veda-on-ComfyUI. Чекпойнт предиктора находится по адресу Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview, а код обучения: veda-sparse/Miowtion. Выпущенный предиктор помечен как предпросмотр: он обучен для 1344x768, 768x1344, 768x768 и 1024x768 при 5, 10 и 14 секундах с 8-шаговой Turbo LoRA; для других размеров используется ближайший обученный план тайлов, и результат стоит сравнивать с полным вниманием.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.