KJNodes/ltxvgenerated

Parche de Atención Sage Eficiente en Memoria LTX2(LTX2MemoryEfficientSageAttentionPatch)

¡EXPERIMENTAL! Activa sageattention personalizado para reducir el uso máximo de VRAM, anula el modo de atención. Requiere la última versión de sageattention.

LTX2 Memory Efficient Sage Attention Patch

model
model
triton_kernels
KJNodes

Descripción

¡EXPERIMENTAL! Este nodo activa un parche sageattention personalizado para reducir el uso máximo de VRAM. Anula el modo de atención actual en el modelo, reemplazándolo con kernels de sageattention eficientes en memoria. Requiere la última versión de la biblioteca sageattention.

Entradas

  • model (MODEL, requerido)
    El modelo de difusión al que se aplicará el parche de atención eficiente en memoria.

  • triton_kernels (BOOLEANO, requerido, predeterminado: verdadero)
    Cuando está habilitado, usa kernels Triton fusionados RoPE para las proyecciones Q/K de la auto-atención. Esto puede reducir aún más la memoria y mejorar el rendimiento, pero requiere que Triton esté instalado.

Salidas

  • MODEL
    El mismo modelo con su modo de atención parcheado para usar sageattention, listo para inferencia con menor uso de VRAM.

Notas de uso

  • Este nodo es experimental. El comportamiento puede cambiar en versiones futuras.
  • Asegúrate de tener instalado el paquete sageattention más reciente (por ejemplo, pip install sageattention --upgrade).
  • Habilitar triton_kernels requiere que Triton esté disponible en tu entorno. Si Triton no está instalado, establece esta entrada en falso.
  • El parche anula el mecanismo de atención incorporado del modelo; afectará a todas las capas de atención del modelo.
  • Se usa típicamente en combinación con flujos de trabajo de la familia LTX2 para reducir los picos de VRAM durante el muestreo.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Parche de Atención Sage Eficiente en Memoria LTX2 (LTX2MemoryEfficientSageAttentionPatch) - ComfyUI-KJNodes | ComfyUI Wiki