Veda Sparse Attention arrive dans ComfyUI : H3 plus rapide

ComfyUI Wikinews

Veda publie un nœud ComfyUI officiel qui remplace l'attention de MiniMax H3 par un prédicteur clairsemé, ignorant 90 % des tuiles pour des vidéos jusqu'à 3 fois plus rapides.

<strong>Veda</strong> est une méthode d'attention clairsemée apprise pour les modèles de diffusion vidéo, issue de ByteDance, HKU et USTC, présentée à l'ICML 2026. Ses auteurs l'ont désormais conditionnée sous forme de nœud personnalisé ComfyUI officiel, <strong>Veda Sparse Attention (MiniMax H3)</strong>, qui exécute l'attention de MiniMax H3 pour environ un dixième de son coût habituel, sans modifier le moindre poids du modèle.
Attention complète FlashAttention-3 à côté de Veda à 95 % de sparsité sur le même clip Waver-T2V-12B

D'après la page du projet Veda : Waver-T2V-12B en 720p, 241 images. Attention complète à gauche, chemin de saut de tuiles de Veda à droite.

Ce que fait Veda

Plutôt que de compresser ou de réentraîner le modèle, Veda apprend quelles parties de la carte d'attention sont importantes. Un prédicteur léger distillé note les tuiles d'attention et n'en conserve qu'environ les 10 % les mieux classées, et un noyau de saut de tuiles ne récupère que les tuiles K/V sélectionnées. Comme il modifie la manière dont l'attention est calculée plutôt que les poids eux-mêmes, il reste compatible avec n'importe quel LoRA ainsi qu'avec les checkpoints MiniMax H3 affinés ou quantifiés.

La page du projet décrit la méthode en trois étapes : l'attention complète max-poolée fournit une distribution enseignante au niveau des tuiles, un estimateur Triplet Pooling avec des projections Q/K par tête reconstruit cette distribution, et une sélection top-k sensible aux têtes émet le masque de tuiles que suit le noyau. La géométrie des tuiles par couche et par tête est choisie pour accueillir des têtes spatiales et temporelles hétérogènes dans un budget matériel fixe.

Sur MiniMax H3, le prédicteur publié est entraîné avec le Turbo LoRA à 8 étapes. Le référentiel précise que le checkpoint est agnostique en termes de modalité et d'étapes : il s'applique à T2VA, FL2VA et R2VA, quel que soit le nombre d'étapes d'échantillonnage, un fine-tuning R2VA dédié étant annoncé pour une future version.

Le nœud ComfyUI

Le nœud est volontairement minimal : MODEL en entrée, MODEL en sortie. Il s'installe comme un remplacement d'attention, il se branche donc sur le fil MODEL après le modèle et les éventuels chargeurs LoRA, et juste avant le GUIDE ou l'ÉCHANTILLONNEUR. Le désactiver avec Ctrl+B génère la même graine avec l'attention complète, pour une comparaison directe.

EntréeValeur par défautDescription
generated_sparsity90%Sparsité de l'attention de la vidéo générée. Un nombre entier tel que 24 conserve à la place exactement ce nombre de tuiles de clés de 128 tokens.
reference_sparsity90%Idem pour les tokens de référence : premières et dernières images, images guides, images et vidéos de référence. 0% leur accorde une attention complète.
full_attention_layersVideBlocs DiT (indexés à partir de 0) qui conservent l'attention complète, par ex. 0, 1, 47-49.
full_attention_stepsVideÉtapes d'échantillonnage (indexées à partir de 0) qui conservent l'attention complète.
verbosedésactivéSignale le temps d'attention par phase, le nombre d'appels et les détails du prédicteur après chaque exécution.

Après une exécution, le nœud indique ce qu'il a réellement fait :

Veda done · Triton INT8 (SM120)
Video: 1344x768 · 5.2 s
Attention computed: 10.9% of full attention (89.1% skipped)

Si un noyau ne peut pas s'exécuter sur le GPU en cours, le nœud le signale et le modèle revient à sa propre attention pour cette exécution, au lieu de produire un rendu défectueux.

Ne cumulez pas ce nœud avec l'Attention clairsemée par blocs du modèle intégrée à ComfyUI sur H3. Ce nœud remplace purement et simplement les blocs d'attention, si bien que Veda ne serait jamais appelé. Le nœud Veda détecte cette combinaison et émet un avertissement.

Performances

T2VA en 1344x768, 124 images (5,2 s), Turbo LoRA à 8 étapes et 90 % de sparsité, mesuré sur une RTX 5070 12 Go sous Windows 11 :

Chemin d'attentionPar étape8 étapesAttention par étape
ComfyUI par défaut40,7 s342 s31,1 s
ComfyUI --use-sage-attention24,8 s231 s15,2 s
Veda clairsemé INT814,0 s130 s4,41 s

Soit environ 2,9x de bout en bout et 7,1x sur l'attention seule, l'écart se creusant avec la longueur du clip. Une seule couche d'attention à 104k tokens avec 90 % de sparsité prend 528 ms, contre 11,8 s pour l'attention complète.

Veda à 95 % de sparsité à côté de la référence FlashAttention-3 sur le même clip

Veda à 95 % de sparsité. Le projet Veda rapporte une accélération de bout en bout de 5,1x sur Waver-T2V-12B en 720p et 241 images, passant de 19,4 minutes à 3,8 minutes.

Le référentiel du prédicteur ajoute des accélérations de bout en bout par rapport à sa propre référence d'attention complète, toutes avec 10 % d'attention conservée et le Turbo LoRA :

GPUClipAccélération de l'attentionAccélération de bout en bout
RTX PRO 6000 Blackwell16:9 · 14,4 s6,79x3,12x
RTX 409016:9 · 5,17 s4,75x1,77x
RTX 409016:9 · 10,1 s6,22x2,42x
RTX 409016:9 · 14,4 s6,31x2,82x

Attention complète à gauche et Veda à droite, même prompt, même graine et même Turbo LoRA, générés sur une seule RTX PRO 6000 Blackwell.

Prise en charge matérielle

Un seul noyau Triton couvre tous les GPU NVIDIA à partir de SM80 sous Windows et Linux, et les puces Apple silicon passent par MLX. Les cartes sans noyau correspondant en sont informées, et le modèle conserve sa propre attention.

MatérielStatut
RTX 30 / A100 / RTX 40 / L40 (sm80-89)chemin de code prêt, pas encore vérifié par les auteurs
H100 / H200 (sm90)chemin de code prêt, pas encore vérifié par les auteurs
B200 / B300 (sm100 / sm103)chemin de code prêt, pas encore vérifié par les auteurs
RTX 50, RTX PRO 6000 Blackwell (sm120)vérifié : RTX 5070, Windows 11
DGX Spark / GB10 (sm121)chemin de code prêt, pas encore vérifié par les auteurs
Apple silicon (série M)vérifié : M3 Pro, macOS 15

Commencer

Veda nécessite ComfyUI 0.38.0 ou une version plus récente. Installez le nœud depuis le Gestionnaire ComfyUI en recherchant « Veda », ou en ligne de commande :

comfy node install veda-sparse-attention

Placez ensuite le prédicteur de 275 Mo dans ComfyUI/models/veda/ :

hf download Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview \
  minimax_h3_t2va_veda_8nfe_600step_preview_fp8.safetensors \
  --local-dir ComfyUI/models/veda

Le nœud ne télécharge rien par lui-même. Le plus simple est d'ouvrir Flux de travail -> Parcourir les modèles -> Veda-on-ComfyUI et de choisir un modèle, ce qui propose le prédicteur dans la boîte de dialogue de modèle manquant de ComfyUI. Deux flux de travail d'exemple accompagnent le référentiel :

Disponibilité

Le nœud est disponible sur le Comfy Registry sous le nom veda-sparse-attention, avec le code source sur veda-sparse/Veda-on-ComfyUI. Le checkpoint du prédicteur se trouve sur Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview, et le code d'entraînement sur veda-sparse/Miowtion. Le prédicteur publié est étiqueté comme un aperçu, entraîné pour 1344x768, 768x1344, 768x768 et 1024x768 à 5, 10 et 14 secondes avec le Turbo LoRA à 8 étapes ; les autres tailles reviennent au plan de tuiles entraîné le plus proche et doivent être comparées à l'attention complète.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Veda Sparse Attention arrive dans ComfyUI : H3 plus rapide | ComfyUI Wiki