Parche de Atención Sage de Memoria Eficiente para WanVideo(WanVideoMemoryEfficientSageAttentionPatch)
EXPERIMENTAL! Activa sageattention personalizado en la autoatención de WanVideo para reducir el uso de VRAM. Requiere la última versión de sageattention.
Wan Video Memory Efficient Sage Attention Patch
Descripción
Un nodo experimental que parchea el mecanismo de auto-atención de WanVideo para usar una implementación personalizada de sageattention, reduciendo el uso máximo de VRAM durante la inferencia. Este nodo anula el modo de atención del modelo.
Requiere la última versión de sageattention – asegúrese de que esté instalado, sea compatible y esté actualizado antes de usar este nodo.
Entradas
| Nombre | Tipo | Descripción |
|---|---|---|
model | MODEL | El modelo WanVideo al cual se aplica el parche de sageattention de memoria eficiente. |
Salidas
| Tipo | Descripción |
|---|---|
MODEL | La misma instancia del modelo con su mecanismo de auto-atención parcheado para usar sageattention. |
Notas de uso
- Este nodo es experimental – el comportamiento puede cambiar en versiones futuras.
- Solo afecta las capas de auto-atención de WanVideo; la atención cruzada u otros componentes permanecen sin cambios.
- El parche se aplica como un envoltorio del modelo; la
MODELde salida se puede usar directamente en nodos de muestreo posteriores. - Si
sageattentionno está instalado o está desactualizado, se generará un error en tiempo de ejecución. - Ejecutar este parche puede alterar la calidad o el comportamiento de la salida – pruebe cuidadosamente con su flujo de trabajo específico.
Instalación (SageAttention)
Esta opción requiere la biblioteca SageAttention instalada en el entorno Python de tu ComfyUI:
- Repositorio oficial (Linux): thu-ml/SageAttention -
pip install sageattention(requierepython>=3.9,torch>=2.3.0,triton>=3.0.0, CUDA>=12.0; consulta el README para los requisitos de versión) - Windows: woct0rdho/SageAttention - wheels precompilados para Windows; instala primero triton-windows y luego elige un wheel de la página de releases que coincida con tu versión de PyTorch (consulta el README)
Para la aceleración global integrada de ComfyUI (sin necesidad de nodo), inicia ComfyUI con --use-sage-attention. Si algunos modelos (p. ej. Wan, Qwen-Image) producen salida negra o con ruido por desbordamiento de cuantización, usa sageattn_qk_int8_pv_fp16_cuda (el que menos probabilidad de desbordar tiene), o ajusta pv_accum_dtype.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.