Veda Sparse Attention arrive dans ComfyUI : H3 plus rapide
Veda publie un nœud ComfyUI officiel qui remplace l'attention de MiniMax H3 par un prédicteur clairsemé, ignorant 90 % des tuiles pour des vidéos jusqu'à 3 fois plus rapides.
D'après la page du projet Veda : Waver-T2V-12B en 720p, 241 images. Attention complète à gauche, chemin de saut de tuiles de Veda à droite.
Ce que fait Veda
Plutôt que de compresser ou de réentraîner le modèle, Veda apprend quelles parties de la carte d'attention sont importantes. Un prédicteur léger distillé note les tuiles d'attention et n'en conserve qu'environ les 10 % les mieux classées, et un noyau de saut de tuiles ne récupère que les tuiles K/V sélectionnées. Comme il modifie la manière dont l'attention est calculée plutôt que les poids eux-mêmes, il reste compatible avec n'importe quel LoRA ainsi qu'avec les checkpoints MiniMax H3 affinés ou quantifiés.
La page du projet décrit la méthode en trois étapes : l'attention complète max-poolée fournit une distribution enseignante au niveau des tuiles, un estimateur Triplet Pooling avec des projections Q/K par tête reconstruit cette distribution, et une sélection top-k sensible aux têtes émet le masque de tuiles que suit le noyau. La géométrie des tuiles par couche et par tête est choisie pour accueillir des têtes spatiales et temporelles hétérogènes dans un budget matériel fixe.
Sur MiniMax H3, le prédicteur publié est entraîné avec le Turbo LoRA à 8 étapes. Le référentiel précise que le checkpoint est agnostique en termes de modalité et d'étapes : il s'applique à T2VA, FL2VA et R2VA, quel que soit le nombre d'étapes d'échantillonnage, un fine-tuning R2VA dédié étant annoncé pour une future version.
Le nœud ComfyUI
Le nœud est volontairement minimal : MODEL en entrée, MODEL en sortie. Il s'installe comme un remplacement d'attention, il se branche donc sur le fil MODEL après le modèle et les éventuels chargeurs LoRA, et juste avant le GUIDE ou l'ÉCHANTILLONNEUR. Le désactiver avec Ctrl+B génère la même graine avec l'attention complète, pour une comparaison directe.
| Entrée | Valeur par défaut | Description |
|---|---|---|
generated_sparsity | 90% | Sparsité de l'attention de la vidéo générée. Un nombre entier tel que 24 conserve à la place exactement ce nombre de tuiles de clés de 128 tokens. |
reference_sparsity | 90% | Idem pour les tokens de référence : premières et dernières images, images guides, images et vidéos de référence. 0% leur accorde une attention complète. |
full_attention_layers | Vide | Blocs DiT (indexés à partir de 0) qui conservent l'attention complète, par ex. 0, 1, 47-49. |
full_attention_steps | Vide | Étapes d'échantillonnage (indexées à partir de 0) qui conservent l'attention complète. |
verbose | désactivé | Signale le temps d'attention par phase, le nombre d'appels et les détails du prédicteur après chaque exécution. |
Après une exécution, le nœud indique ce qu'il a réellement fait :
Veda done · Triton INT8 (SM120)
Video: 1344x768 · 5.2 s
Attention computed: 10.9% of full attention (89.1% skipped)Si un noyau ne peut pas s'exécuter sur le GPU en cours, le nœud le signale et le modèle revient à sa propre attention pour cette exécution, au lieu de produire un rendu défectueux.
Performances
T2VA en 1344x768, 124 images (5,2 s), Turbo LoRA à 8 étapes et 90 % de sparsité, mesuré sur une RTX 5070 12 Go sous Windows 11 :
| Chemin d'attention | Par étape | 8 étapes | Attention par étape |
|---|---|---|---|
| ComfyUI par défaut | 40,7 s | 342 s | 31,1 s |
ComfyUI --use-sage-attention | 24,8 s | 231 s | 15,2 s |
| Veda clairsemé INT8 | 14,0 s | 130 s | 4,41 s |
Soit environ 2,9x de bout en bout et 7,1x sur l'attention seule, l'écart se creusant avec la longueur du clip. Une seule couche d'attention à 104k tokens avec 90 % de sparsité prend 528 ms, contre 11,8 s pour l'attention complète.
Veda à 95 % de sparsité. Le projet Veda rapporte une accélération de bout en bout de 5,1x sur Waver-T2V-12B en 720p et 241 images, passant de 19,4 minutes à 3,8 minutes.
Le référentiel du prédicteur ajoute des accélérations de bout en bout par rapport à sa propre référence d'attention complète, toutes avec 10 % d'attention conservée et le Turbo LoRA :
| GPU | Clip | Accélération de l'attention | Accélération de bout en bout |
|---|---|---|---|
| RTX PRO 6000 Blackwell | 16:9 · 14,4 s | 6,79x | 3,12x |
| RTX 4090 | 16:9 · 5,17 s | 4,75x | 1,77x |
| RTX 4090 | 16:9 · 10,1 s | 6,22x | 2,42x |
| RTX 4090 | 16:9 · 14,4 s | 6,31x | 2,82x |
Attention complète à gauche et Veda à droite, même prompt, même graine et même Turbo LoRA, générés sur une seule RTX PRO 6000 Blackwell.
Prise en charge matérielle
Un seul noyau Triton couvre tous les GPU NVIDIA à partir de SM80 sous Windows et Linux, et les puces Apple silicon passent par MLX. Les cartes sans noyau correspondant en sont informées, et le modèle conserve sa propre attention.
| Matériel | Statut |
|---|---|
| RTX 30 / A100 / RTX 40 / L40 (sm80-89) | chemin de code prêt, pas encore vérifié par les auteurs |
| H100 / H200 (sm90) | chemin de code prêt, pas encore vérifié par les auteurs |
| B200 / B300 (sm100 / sm103) | chemin de code prêt, pas encore vérifié par les auteurs |
| RTX 50, RTX PRO 6000 Blackwell (sm120) | vérifié : RTX 5070, Windows 11 |
| DGX Spark / GB10 (sm121) | chemin de code prêt, pas encore vérifié par les auteurs |
| Apple silicon (série M) | vérifié : M3 Pro, macOS 15 |
Commencer
Veda nécessite ComfyUI 0.38.0 ou une version plus récente. Installez le nœud depuis le Gestionnaire ComfyUI en recherchant « Veda », ou en ligne de commande :
comfy node install veda-sparse-attentionPlacez ensuite le prédicteur de 275 Mo dans ComfyUI/models/veda/ :
hf download Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview \
minimax_h3_t2va_veda_8nfe_600step_preview_fp8.safetensors \
--local-dir ComfyUI/models/vedaLe nœud ne télécharge rien par lui-même. Le plus simple est d'ouvrir Flux de travail -> Parcourir les modèles -> Veda-on-ComfyUI et de choisir un modèle, ce qui propose le prédicteur dans la boîte de dialogue de modèle manquant de ComfyUI. Deux flux de travail d'exemple accompagnent le référentiel :
Disponibilité
Le nœud est disponible sur le Comfy Registry sous le nom veda-sparse-attention, avec le code source sur veda-sparse/Veda-on-ComfyUI. Le checkpoint du prédicteur se trouve sur Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview, et le code d'entraînement sur veda-sparse/Miowtion. Le prédicteur publié est étiqueté comme un aperçu, entraîné pour 1344x768, 768x1344, 768x768 et 1024x768 à 5, 10 et 14 secondes avec le Turbo LoRA à 8 étapes ; les autres tailles reviennent au plan de tuiles entraîné le plus proche et doivent être comparées à l'attention complète.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.