Correctif Sage Attention Mémoire Efficace LTX2(LTX2MemoryEfficientSageAttentionPatch)
EXPÉRIMENTAL ! Active un sageattention personnalisé pour réduire l'utilisation maximale de la VRAM, remplace le mode d'attention. Nécessite la dernière version de sageattention.
LTX2 Memory Efficient Sage Attention Patch
Description
EXPÉRIMENTAL ! Ce nœud active un correctif sageattention personnalisé pour réduire l'utilisation maximale de la VRAM. Il remplace le mode d'attention actuel dans le modèle, le remplaçant par des noyaux sageattention économes en mémoire. Nécessite la dernière version de la bibliothèque sageattention.
Entrées
-
modèle (
MODEL, requis)
Le modèle de diffusion auquel le correctif d'attention économe en mémoire sera appliqué. -
triton_kernels (
BOOLEAN, requis, défaut :vrai)
Lorsqu'il est activé, utilise les noyaux RoPE fusionnés Triton pour les projections Q/K de l'auto-attention. Cela peut réduire encore la mémoire et améliorer les performances, mais nécessite que Triton soit installé.
Sorties
MODEL
Le même modèle avec son mode d'attention modifié pour utiliser sageattention, prêt pour l'inférence avec une utilisation moindre de la VRAM.
Notes d'utilisation
- Ce nœud est expérimental : le comportement peut changer dans les versions futures.
- Assurez-vous d'avoir la dernière version du paquet
sageattentioninstallée (par exemple,pip install sageattention --upgrade). - L'activation de
triton_kernelsnécessite que Triton soit disponible dans votre environnement. Si Triton n'est pas installé, réglez cette entrée surfaux. - Le correctif remplace le mécanisme d'attention intégré du modèle ; il affectera tous les calques d'attention du modèle.
- Généralement utilisé en combinaison avec les flux de travail de la famille
LTX2pour réduire les pics de VRAM pendant l'échantillonnage.
Installation (SageAttention)
Cette option nécessite l'installation de la bibliothèque SageAttention dans l'environnement Python de votre ComfyUI :
- Dépôt officiel (Linux) : thu-ml/SageAttention -
pip install sageattention(nécessitepython>=3.9,torch>=2.3.0,triton>=3.0.0, CUDA>=12.0 ; voir le README pour les exigences de version) - Windows : woct0rdho/SageAttention - wheels précompilés pour Windows ; installez d'abord triton-windows, puis choisissez un wheel sur la page des releases correspondant à votre version de PyTorch (voir le README)
Pour l'accélération globale intégrée de ComfyUI (sans nœud), démarrez ComfyUI avec --use-sage-attention. Si certains modèles (par ex. Wan, Qwen-Image) produisent une sortie noire ou bruitée en raison d'un débordement de quantification, utilisez sageattn_qk_int8_pv_fp16_cuda (le moins susceptible de déborder), ou ajustez pv_accum_dtype.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.