Descripción
¡EXPERIMENTAL! Este nodo modifica el pase directo de un modelo LTX2 para aplicar factores de escalado de atención por modalidad. También reduce el uso máximo de VRAM en comparación con el pase directo sin parche. Úselo para ajustar finamente la influencia de los flujos de atención de vídeo y audio durante la generación.
Entradas
-
model(MODELO, requerido) – El modelo LTX2 a parchear. Debe ser un modelo compatible cargado en ComfyUI. -
blocks(CADENA, requerido, predeterminado:"") – Lista separada por comas de índices de bloques del transformador para aplicar el parche. Déjelo vacío para aplicar a todos los bloques. Ejemplo:"0,2,4"solo parchearía los bloques 0, 2 y 4. -
video_scale(FLOTANTE, predeterminado:1.0, rango:0.0–100.0, paso0.01) – Factor de escalado para la atención de vídeo a vídeo (auto-atención dentro de la modalidad de vídeo). -
audio_scale(FLOTANTE, predeterminado:1.0, rango:0.0–100.0, paso0.01) – Factor de escalado para la atención de audio a audio (auto-atención dentro de la modalidad de audio). -
audio_to_video_scale(FLOTANTE, predeterminado:1.0, rango:0.0–100.0, paso0.01) – Factor de escalado para la atención cruzada de audio a vídeo. Controla cuánta información de audio influye en la representación de vídeo. (Tooltip: "Factor de escalado para la atención de vídeo." – probablemente una abreviatura del efecto en la atención de vídeo desde audio.) -
video_to_audio_scale(FLOTANTE, predeterminado:1.0, rango:0.0–100.0, paso0.01) – Factor de escalado para la atención cruzada de vídeo a audio. Controla cuánta información de vídeo influye en la representación de audio. (Tooltip: "Factor de escalado para la atención de audio." – abreviatura correspondiente.) -
triton_kernels(BOOLEANO, predeterminado:True) – Cuando está habilitado, utiliza núcleos fusionados de Triton para las operaciones de norm+scale+shift y aplicación de RoPE. Esto puede ser ligeramente más rápido, pero requiere un entorno compatible con Triton instalado. Desactívelo si encuentra errores o prefiere una alternativa pura de PyTorch.
Salidas
MODELO– El modelo LTX2 parcheado con las modificaciones de escalado de atención aplicadas.
Notas de Uso
- Este nodo es experimental. Haga una copia de seguridad de sus flujos de trabajo y pruebe a fondo antes de confiar en los resultados.
- Debido a que el nodo modifica el pase directo, el modelo parcheado utilizará una implementación de atención personalizada que reduce el consumo máximo de VRAM, útil para generaciones más grandes o cuando la memoria es limitada.
- La entrada
blocksle permite parchear selectivamente solo ciertos bloques del transformador. Esto puede ayudar a aislar efectos o reducir el impacto en el rendimiento del parche. - Todos los factores de escalado actúan como multiplicadores en los logits de atención brutos antes de softmax. Un valor de
1.0deja la atención sin cambios; valores >1.0amplifican la contribución de esa modalidad, valores <1.0la atenúan. - Los cuatro factores de escalado (vídeo, audio, audio→vídeo, vídeo→audio) le brindan control independiente sobre la atención intra-modalidad y entre modalidades. Por ejemplo, para hacer que la generación de vídeo sea más sensible a la pista de audio, aumente
audio_to_video_scale. - Si no necesita ajustes entre modalidades, deje
audio_to_video_scaleyvideo_to_audio_scaleen1.0y solo ajustevideo_scaleyaudio_scale. - La opción
triton_kernelsgeneralmente es segura dejarla habilitada; solo acelera ligeramente el pase directo parcheado. Desactívela si Triton no está instalado o causa problemas de compatibilidad.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.