Descripción
Aplica la Guía de Atención Normalizada (NAG) al modelo dado durante la inferencia. Esta técnica modifica el mecanismo de atención para reducir artefactos y mejorar la calidad de generación, especialmente en el contexto de generación de vídeo largo con LTXV. El nodo se basa en el enfoque descrito en el repositorio de Normalized-Attention-Guidance.
Entradas
| Nombre | Tipo | Requerido | Predeterminado | Rango | Descripción |
|---|---|---|---|---|---|
model | MODEL | Sí | — | — | El modelo de difusión de entrada al que aplicar NAG. |
nag_scale | FLOAT | Sí | 11.0 | 0.0 – 100.0 (paso 0.001) | Fuerza del efecto de orientación negativa. Valores más altos producen una corrección más fuerte. |
nag_alpha | FLOAT | Sí | 0.25 | 0.0 – 1.0 (paso 0.001) | Coeficiente de mezcla que controla el equilibrio entre la representación guiada normalizada y la representación positiva original. |
nag_tau | FLOAT | Sí | 2.5 | 0.0 – 10.0 (paso 0.001) | Umbral de recorte que limita cuánto puede desviarse la atención guiada de la atención positiva. |
nag_cond_video | CONDITIONING | No | — | — | Acondicionamiento de vídeo opcional para guiar la normalización de la atención. |
nag_cond_audio | CONDITIONING | No | — | — | Acondicionamiento de audio opcional para guiar la normalización de la atención. |
inplace | BOOLEAN | No | True | — | Si está habilitado, modifica los tensores en el lugar para ahorrar memoria. Puede producir resultados numéricos ligeramente diferentes en comparación con las operaciones fuera de lugar. |
Salidas
| Nombre | Tipo | Descripción |
|---|---|---|
model | MODEL | El mismo modelo con NAG aplicado a sus operaciones internas de atención. |
Notas de uso
- Este nodo está diseñado para usarse con el pipeline de generación de vídeo LTXV (categoría
KJNodes/ltxv). Modifica la ruta directa del modelo, por lo que debe conectarse antes del proceso de muestreo. - Los tres parámetros (
nag_scale,nag_alpha,nag_tau) controlan conjuntamente el comportamiento de la orientación. Comience con los valores predeterminados y ajuste según la calidad visual: aumentarnag_scalegeneralmente reduce la sobreexposición y los artefactos, mientras quenag_alphaynag_tauajustan finamente la normalización. nag_cond_videoynag_cond_audioson opcionales. Cuando se proporcionan, suministran señales de acondicionamiento adicionales que influyen en la normalización de la atención. Déjelos desconectados si no se desea dicho acondicionamiento.- Habilitar
inplace(el valor predeterminado) reduce el uso de memoria durante la inferencia. Si observa inconsistencias numéricas entre ejecuciones o necesita reproducibilidad exacta, establezcainplaceenFalse.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.