Veda Sparse Attention в ComfyUI: ускорение MiniMax H3

ComfyUI Wikinews

Команда Veda выпустила официальный узел ComfyUI, который заменяет внимание MiniMax H3 дистиллированным разреженным предиктором и пропускает 90% внимания, ускоряя видео до 3 раз.

<strong>Veda</strong> : метод обученного разреженного внимания для моделей видео-диффузии от ByteDance, HKU и USTC, представленный на ICML 2026. Его авторы упаковали метод в официальный пользовательский узел ComfyUI, <strong>Veda Sparse Attention (MiniMax H3)</strong>, который выполняет внимание MiniMax H3 примерно за десятую часть обычной стоимости, не изменяя ни одного веса модели.
Полное внимание FlashAttention-3 рядом с Veda при разреженности 95% на одном и том же клипе Waver-T2V-12B

Со страницы проекта Veda: Waver-T2V-12B при 720p, 241 кадр. Слева полное внимание, справа путь Veda с пропуском тайлов.

Что делает Veda

Вместо сжатия или переобучения модели Veda определяет, какие части карты внимания важны. Дистиллированный лёгкий предиктор оценивает тайлы внимания и оставляет примерно топ-10%, а ядро с пропуском тайлов выбирает только отобранные тайлы K/V. Поскольку метод меняет способ вычисления внимания, а не сами веса, он остаётся совместим с любыми LoRA и с дообученными или квантованными чекпойнтами MiniMax H3.

Страница проекта описывает метод в три этапа: полное внимание с max-пулингом формирует учительское распределение на уровне тайлов, оценщик Triplet Pooling с проекциями Q/K для каждой головы восстанавливает это распределение, а выбор top-k с учётом голов формирует маску тайлов, которой следует ядро. Геометрия тайлов для каждого слоя и каждой головы подбирается так, чтобы разнородные пространственные и временные головы укладывались в фиксированный бюджет оборудования.

Для MiniMax H3 выпущенный предиктор обучен с 8-шаговой Turbo LoRA. В репозитории отмечено, что чекпойнт не зависит от модальности и числа шагов: он применим к T2VA, FL2VA и R2VA при любом числе шагов выборки, а отдельный fine-tune для R2VA анонсирован в будущем релизе.

Узел ComfyUI

Узел намеренно минималистичен: MODEL на входе, MODEL на выходе. Он устанавливается как переопределение внимания, поэтому подключается к линии MODEL после модели и любых загрузчиков LoRA и непосредственно перед ГИДом или СЭМПЛЕРом. Обход узла через Ctrl+B отрендерит тот же seed с полным вниманием для прямого сравнения.

ВходПо умолчаниюОписание
generated_sparsity90%Разреженность внимания сгенерированного видео. Целое число, например 24, сохраняет ровно столько тайлов ключей по 128 токенов.
reference_sparsity90%То же для референсных токенов: первого и последнего кадров, управляющих кадров, референсных изображений и видео. 0% даёт им полное внимание.
full_attention_layersпустоБлоки DiT с нумерацией от 0, сохраняющие полное внимание, например 0, 1, 47-49.
full_attention_stepsпустоШаги выборки с нумерацией от 0, сохраняющие полное внимание.
verboseвыкл.Выводить тайминги внимания по фазам, число вызовов и детали предиктора после каждого запуска.

После запуска узел выводит, что он фактически сделал:

Veda done · Triton INT8 (SM120)
Video: 1344x768 · 5.2 s
Attention computed: 10.9% of full attention (89.1% skipped)

Если ядро не может выполниться на текущем GPU, узел сообщает об этом, и модель для этого запуска использует собственное внимание вместо того, чтобы выдать испорченный рендер.

Не используйте этот узел вместе с собственным Model Sparse Attention из ComfyUI на H3. Тот узел полностью заменяет блоки внимания, поэтому Veda вообще не будет вызван. Узел Veda распознаёт такое сочетание и предупреждает о нём.

Производительность

T2VA при 1344x768, 124 кадра (5,2 с), 8-шаговая Turbo LoRA и разреженность 90%, замерено на RTX 5070 12 ГБ под Windows 11:

Путь вниманияНа шаг8 шаговВнимание на шаг
ComfyUI по умолчанию40,7 с342 с31,1 с
ComfyUI --use-sage-attention24,8 с231 с15,2 с
Veda sparse INT814,0 с130 с4,41 с

Это примерно в 2,9 раза быстрее от начала до конца и в 7,1 раза быстрее по одному вниманию, причём разрыв растёт с длиной клипа. Один слой внимания при 104 тыс. токенов с разреженностью 90% занимает 528 мс против 11,8 с для полного внимания.

Veda при разреженности 95% рядом с базовым уровнем FlashAttention-3 на том же клипе

Veda при разреженности 95%. Проект Veda сообщает об ускорении в 5,1 раза от начала до конца на Waver-T2V-12B при 720p и 241 кадре: с 19,4 минуты до 3,8 минуты.

Репозиторий предиктора приводит ускорение от начала до конца относительно собственного базового полного внимания, всё при сохранении 10% внимания с Turbo LoRA:

GPUКлипУскорение вниманияУскорение от начала до конца
RTX PRO 6000 Blackwell16:9 · 14,4 с6,79x3,12x
RTX 409016:9 · 5,17 с4,75x1,77x
RTX 409016:9 · 10,1 с6,22x2,42x
RTX 409016:9 · 14,4 с6,31x2,82x

Слева полное внимание, справа Veda: одинаковый промпт, seed и Turbo LoRA, сгенерировано на одной RTX PRO 6000 Blackwell.

Поддержка оборудования

Одно ядро Triton охватывает все GPU NVIDIA начиная с SM80 под Windows и Linux, а Apple silicon работает через MLX. Для карт без подходящего ядра узел сообщает об этом, и модель сохраняет собственное внимание.

ОборудованиеСтатус
RTX 30 / A100 / RTX 40 / L40 (sm80-89)путь кода готов, авторы пока не проверяли
H100 / H200 (sm90)путь кода готов, авторы пока не проверяли
B200 / B300 (sm100 / sm103)путь кода готов, авторы пока не проверяли
RTX 50, RTX PRO 6000 Blackwell (sm120)проверено: RTX 5070, Windows 11
DGX Spark / GB10 (sm121)путь кода готов, авторы пока не проверяли
Apple silicon (M series)проверено: M3 Pro, macOS 15

Начало работы

Veda требует ComfyUI 0.38.0 или новее. Установите узел через Менеджер ComfyUI, найдя «Veda», или из CLI:

comfy node install veda-sparse-attention

Затем поместите предиктор размером 275 МБ в ComfyUI/models/veda/:

hf download Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview \
  minimax_h3_t2va_veda_8nfe_600step_preview_fp8.safetensors \
  --local-dir ComfyUI/models/veda

Узел ничего не скачивает сам. Проще открыть Рабочий процесс -> Просмотреть шаблоны -> Veda-on-ComfyUI и выбрать шаблон: он предложит предиктор в диалоге отсутствующих моделей ComfyUI. В репозитории есть два примера рабочих процессов:

Доступность

Узел доступен в Comfy Registry как veda-sparse-attention, исходный код: veda-sparse/Veda-on-ComfyUI. Чекпойнт предиктора находится по адресу Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview, а код обучения: veda-sparse/Miowtion. Выпущенный предиктор помечен как предпросмотр: он обучен для 1344x768, 768x1344, 768x768 и 1024x768 при 5, 10 и 14 секундах с 8-шаговой Turbo LoRA; для других размеров используется ближайший обученный план тайлов, и результат стоит сравнивать с полным вниманием.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Veda Sparse Attention в ComfyUI: ускорение MiniMax H3 | ComfyUI Wiki