Description
Nœud expérimental pour patcher le mécanisme d'attention d'un modèle de diffusion afin d'utiliser Flash Attention (via la bibliothèque flash_attn). Contrairement au repli SDPA par défaut de ComfyUI, ce nœud applique directement Flash Attention. Pour désactiver le correctif, contournez ou déconnectez ce nœud. La bibliothèque Python flash_attn doit être installée (exécutez pip install flash-attn).
Entrées
| Nom | Type | Requis | Par défaut | Description |
|---|---|---|---|---|
model | MODEL | Oui | – | Le modèle de diffusion à patcher. Les calques d'attention seront remplacés par des opérations Flash Attention. |
allow_compile | BOOLEAN | Non | Faux | Si True, permet de compiler les noyaux Flash Attention (par exemple, avec torch.compile de PyTorch) pour des gains de performances potentiels. Cela peut augmenter le temps de démarrage et l'utilisation de la mémoire. Activez uniquement si votre environnement est compatible. |
Sorties
| Nom | Type | Description |
|---|---|---|
MODEL | MODEL | Le modèle patché avec Flash Attention activé. |
Notes d'utilisation
- Ce nœud est expérimental et peut ne pas fonctionner avec toutes les architectures de modèles ou configurations CUDA.
- La bibliothèque
flash_attndoit être installée dans votre environnement. Instructions d'installation :pip install flash-attn(peut nécessiter une version de torch compatible CUDA). - En cas d'erreurs, essayez de contourner le nœud pour revenir au mécanisme d'attention par défaut.
- L'option
allow_compileest désactivée par défaut ; activez-la uniquement si vous comprenez les implications (première inférence plus longue, instabilité potentielle).
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.