KJNodes/ltxvgenerated

Parche de Ajuste de Atención LTX2(LTX2AttentionTunerPatch)

¡EXPERIMENTAL! Pase directo personalizado de LTX2 con factores de escalado de atención por modalidad, también reduce el uso máximo de VRAM.

LTX2 Attention Tuner Patch

model
model
blocks
STRING
video_scale
1.00
audio_scale
1.00
audio_to_video_scale
1.00
video_to_audio_scale
1.00
triton_kernels
KJNodes

Descripción

¡EXPERIMENTAL! Este nodo modifica el pase directo de un modelo LTX2 para aplicar factores de escalado de atención por modalidad. También reduce el uso máximo de VRAM en comparación con el pase directo sin parche. Úselo para ajustar finamente la influencia de los flujos de atención de vídeo y audio durante la generación.

Entradas

  • model (MODELO, requerido) – El modelo LTX2 a parchear. Debe ser un modelo compatible cargado en ComfyUI.

  • blocks (CADENA, requerido, predeterminado: "") – Lista separada por comas de índices de bloques del transformador para aplicar el parche. Déjelo vacío para aplicar a todos los bloques. Ejemplo: "0,2,4" solo parchearía los bloques 0, 2 y 4.

  • video_scale (FLOTANTE, predeterminado: 1.0, rango: 0.0100.0, paso 0.01) – Factor de escalado para la atención de vídeo a vídeo (auto-atención dentro de la modalidad de vídeo).

  • audio_scale (FLOTANTE, predeterminado: 1.0, rango: 0.0100.0, paso 0.01) – Factor de escalado para la atención de audio a audio (auto-atención dentro de la modalidad de audio).

  • audio_to_video_scale (FLOTANTE, predeterminado: 1.0, rango: 0.0100.0, paso 0.01) – Factor de escalado para la atención cruzada de audio a vídeo. Controla cuánta información de audio influye en la representación de vídeo. (Tooltip: "Factor de escalado para la atención de vídeo." – probablemente una abreviatura del efecto en la atención de vídeo desde audio.)

  • video_to_audio_scale (FLOTANTE, predeterminado: 1.0, rango: 0.0100.0, paso 0.01) – Factor de escalado para la atención cruzada de vídeo a audio. Controla cuánta información de vídeo influye en la representación de audio. (Tooltip: "Factor de escalado para la atención de audio." – abreviatura correspondiente.)

  • triton_kernels (BOOLEANO, predeterminado: True) – Cuando está habilitado, utiliza núcleos fusionados de Triton para las operaciones de norm+scale+shift y aplicación de RoPE. Esto puede ser ligeramente más rápido, pero requiere un entorno compatible con Triton instalado. Desactívelo si encuentra errores o prefiere una alternativa pura de PyTorch.

Salidas

  • MODELO – El modelo LTX2 parcheado con las modificaciones de escalado de atención aplicadas.

Notas de Uso

  • Este nodo es experimental. Haga una copia de seguridad de sus flujos de trabajo y pruebe a fondo antes de confiar en los resultados.
  • Debido a que el nodo modifica el pase directo, el modelo parcheado utilizará una implementación de atención personalizada que reduce el consumo máximo de VRAM, útil para generaciones más grandes o cuando la memoria es limitada.
  • La entrada blocks le permite parchear selectivamente solo ciertos bloques del transformador. Esto puede ayudar a aislar efectos o reducir el impacto en el rendimiento del parche.
  • Todos los factores de escalado actúan como multiplicadores en los logits de atención brutos antes de softmax. Un valor de 1.0 deja la atención sin cambios; valores > 1.0 amplifican la contribución de esa modalidad, valores < 1.0 la atenúan.
  • Los cuatro factores de escalado (vídeo, audio, audio→vídeo, vídeo→audio) le brindan control independiente sobre la atención intra-modalidad y entre modalidades. Por ejemplo, para hacer que la generación de vídeo sea más sensible a la pista de audio, aumente audio_to_video_scale.
  • Si no necesita ajustes entre modalidades, deje audio_to_video_scale y video_to_audio_scale en 1.0 y solo ajuste video_scale y audio_scale.
  • La opción triton_kernels generalmente es segura dejarla habilitada; solo acelera ligeramente el pase directo parcheado. Desactívela si Triton no está instalado o causa problemas de compatibilidad.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Parche de Ajuste de Atención LTX2 (LTX2AttentionTunerPatch) - ComfyUI-KJNodes | ComfyUI Wiki