Correctif d'attention Sage à mémoire efficace pour WanVideo(WanVideoMemoryEfficientSageAttentionPatch)
EXPÉRIMENTAL ! Active sageattention personnalisé sur l'auto-attention de WanVideo pour réduire l'utilisation de VRAM. Nécessite la dernière version de sageattention.
Wan Video Memory Efficient Sage Attention Patch
Description
Un nœud expérimental qui corrige le mécanisme d'auto-attention de WanVideo pour utiliser une implémentation sageattention personnalisée, réduisant ainsi l'utilisation maximale de la mémoire VRAM lors de l'inférence. Ce nœud remplace le mode d'attention du modèle.
Nécessite la dernière version de sageattention – assurez-vous qu'elle est installée, compatible et à jour avant d'utiliser ce nœud.
Entrées
| Nom | Type | Description |
|---|---|---|
model | MODEL | Le modèle WanVideo auquel le correctif d'attention Sage à mémoire efficace est appliqué. |
Sorties
| Type | Description |
|---|---|
MODEL | La même instance de modèle avec son mécanisme d'auto-attention corrigé pour utiliser sageattention. |
Remarques d'utilisation
- Ce nœud est expérimental – son comportement peut changer dans les futures versions.
- Il n'affecte que les calques d'auto-attention de WanVideo ; l'attention croisée ou d'autres composants restent inchangés.
- Le correctif est appliqué comme un wrapper de modèle ; la
sortieMODELpeut être utilisée directement dans les nœuds d'échantillonnage suivants. - Si
sageattentionn'est pas installé ou est obsolète, une erreur sera levée lors de l'exécution. - L'application de ce correctif peut altérer la qualité ou le comportement de la sortie – testez soigneusement avec votre flux de travail spécifique.
Installation (SageAttention)
Cette option nécessite l'installation de la bibliothèque SageAttention dans l'environnement Python de votre ComfyUI :
- Dépôt officiel (Linux) : thu-ml/SageAttention -
pip install sageattention(nécessitepython>=3.9,torch>=2.3.0,triton>=3.0.0, CUDA>=12.0 ; voir le README pour les exigences de version) - Windows : woct0rdho/SageAttention - wheels précompilés pour Windows ; installez d'abord triton-windows, puis choisissez un wheel sur la page des releases correspondant à votre version de PyTorch (voir le README)
Pour l'accélération globale intégrée de ComfyUI (sans nœud), démarrez ComfyUI avec --use-sage-attention. Si certains modèles (par ex. Wan, Qwen-Image) produisent une sortie noire ou bruitée en raison d'un débordement de quantification, utilisez sageattn_qk_int8_pv_fp16_cuda (le moins susceptible de déborder), ou ajustez pv_accum_dtype.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.