Parche de Atención Sage Eficiente en Memoria LTX2(LTX2MemoryEfficientSageAttentionPatch)
¡EXPERIMENTAL! Activa sageattention personalizado para reducir el uso máximo de VRAM, anula el modo de atención. Requiere la última versión de sageattention.
LTX2 Memory Efficient Sage Attention Patch
Descripción
¡EXPERIMENTAL! Este nodo activa un parche sageattention personalizado para reducir el uso máximo de VRAM. Anula el modo de atención actual en el modelo, reemplazándolo con kernels de sageattention eficientes en memoria. Requiere la última versión de la biblioteca sageattention.
Entradas
-
model (
MODEL, requerido)
El modelo de difusión al que se aplicará el parche de atención eficiente en memoria. -
triton_kernels (
BOOLEANO, requerido, predeterminado:verdadero)
Cuando está habilitado, usa kernels Triton fusionados RoPE para las proyecciones Q/K de la auto-atención. Esto puede reducir aún más la memoria y mejorar el rendimiento, pero requiere que Triton esté instalado.
Salidas
MODEL
El mismo modelo con su modo de atención parcheado para usar sageattention, listo para inferencia con menor uso de VRAM.
Notas de uso
- Este nodo es experimental. El comportamiento puede cambiar en versiones futuras.
- Asegúrate de tener instalado el paquete
sageattentionmás reciente (por ejemplo,pip install sageattention --upgrade). - Habilitar
triton_kernelsrequiere que Triton esté disponible en tu entorno. Si Triton no está instalado, establece esta entrada enfalso. - El parche anula el mecanismo de atención incorporado del modelo; afectará a todas las capas de atención del modelo.
- Se usa típicamente en combinación con flujos de trabajo de la familia
LTX2para reducir los picos de VRAM durante el muestreo.
Instalación (SageAttention)
Esta opción requiere la biblioteca SageAttention instalada en el entorno Python de tu ComfyUI:
- Repositorio oficial (Linux): thu-ml/SageAttention -
pip install sageattention(requierepython>=3.9,torch>=2.3.0,triton>=3.0.0, CUDA>=12.0; consulta el README para los requisitos de versión) - Windows: woct0rdho/SageAttention - wheels precompilados para Windows; instala primero triton-windows y luego elige un wheel de la página de releases que coincida con tu versión de PyTorch (consulta el README)
Para la aceleración global integrada de ComfyUI (sin necesidad de nodo), inicia ComfyUI con --use-sage-attention. Si algunos modelos (p. ej. Wan, Qwen-Image) producen salida negra o con ruido por desbordamiento de cuantización, usa sageattn_qk_int8_pv_fp16_cuda (el que menos probabilidad de desbordar tiene), o ajusta pv_accum_dtype.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.