KJNodes/ltxvgenerated

LTX2 Attention Tuner Patch(LTX2AttentionTunerPatch)

ЭКСПЕРИМЕНТАЛЬНО! Пользовательский прямой проход LTX2 с коэффициентами масштабирования внимания по модальностям, также снижает пиковое использование VRAM.

LTX2 Attention Tuner Patch

model
model
blocks
STRING
video_scale
1.00
audio_scale
1.00
audio_to_video_scale
1.00
video_to_audio_scale
1.00
triton_kernels
KJNodes

Description

ЭКСПЕРИМЕНТАЛЬНО! Этот узел накладывает патч на прямой проход модели LTX2 для применения по-модальных коэффициентов масштабирования внимания. Он также снижает пиковое использование VRAM по сравнению с непатченным прямым проходом. Используйте его для точной настройки влияния потоков внимания видео и аудио во время генерации.

Inputs

  • model (MODEL, обязательно) – Модель LTX2 для наложения патча. Должна быть совместимая модель, загруженная в ComfyUI.

  • blocks (СТРОКА, обязательно, по умолчанию: "") – Список индексов блоков трансформера, разделённых запятыми, к которым применяется патч. Оставьте пустым, чтобы применить ко всем блокам. Пример: "0,2,4" наложит патч только на блоки 0, 2 и 4.

  • video_scale (ПЛАВАЮЩИЙ, по умолчанию: 1.0, диапазон: 0.0100.0, шаг 0.01) – Коэффициент масштабирования для внимания видео-к-видео (самовнимание в модальности видео).

  • audio_scale (ПЛАВАЮЩИЙ, по умолчанию: 1.0, диапазон: 0.0100.0, шаг 0.01) – Коэффициент масштабирования для внимания аудио-к-аудио (самовнимание в модальности аудио).

  • audio_to_video_scale (ПЛАВАЮЩИЙ, по умолчанию: 1.0, диапазон: 0.0100.0, шаг 0.01) – Коэффициент масштабирования для кросс-внимания от аудио к видео. Управляет тем, насколько аудио-информация влияет на представление видео. (Подсказка: «Коэффициент масштабирования для внимания видео.»: вероятно, сокращение для эффекта на видео-внимание от аудио.)

  • video_to_audio_scale (ПЛАВАЮЩИЙ, по умолчанию: 1.0, диапазон: 0.0100.0, шаг 0.01) – Коэффициент масштабирования для кросс-внимания от видео к аудио. Управляет тем, насколько видео-информация влияет на представление аудио. (Подсказка: «Коэффициент масштабирования для внимания аудио.»: соответствующее сокращение.)

  • triton_kernels (БУЛЕВО, по умолчанию: True) – Если включено, использует объединённые ядра Triton для операций нормы+масштабирования+сдвига и RoPE. Это может быть очень немного быстрее, но требует совместимой среды с установленным Triton. Отключите, если возникают ошибки или вы предпочитаете чистый резервный вариант на PyTorch.

Outputs

  • MODEL – Модель LTX2 с наложенным патчем, с применёнными модификациями масштабирования внимания.

Usage Notes

  • Этот узел является экспериментальным. Сделайте резервные копии ваших рабочих процессов и тщательно тестируйте, прежде чем полагаться на результаты.
  • Поскольку узел модифицирует прямой проход, патченная модель будет использовать пользовательскую реализацию внимания, которая снижает пиковое потребление VRAM - полезно для более крупных генераций или при ограниченной памяти.
  • Вход blocks позволяет выборочно патчить только определённые блоки трансформера. Это может помочь изолировать эффекты или уменьшить влияние патча на производительность.
  • Все коэффициенты масштабирования действуют как множители необработанных логитов внимания перед softmax. Значение 1.0 оставляет внимание без изменений; значения > 1.0 усиливают вклад этой модальности, значения < 1.0 ослабляют его.
  • Четыре коэффициента масштабирования (видео, аудио, аудио→видео, видео→аудио) дают вам независимый контроль над внутри-модальным и кросс-модальным вниманием. Например, чтобы сделать генерацию видео более чувствительной к аудиодорожке, увеличьте audio_to_video_scale.
  • Если вам не нужны корректировки кросс-модальности, оставьте audio_to_video_scale и video_to_audio_scale на 1.0 и изменяйте только video_scale и audio_scale.
  • Опцию triton_kernels обычно можно оставить включённой; она лишь немного ускоряет патченный прямой проход. Отключите, если Triton не установлен или вызывает проблемы совместимости.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
LTX2 Attention Tuner Patch (LTX2AttentionTunerPatch) - ComfyUI-KJNodes | ComfyUI Wiki