Description
ЭКСПЕРИМЕНТАЛЬНО! Этот узел накладывает патч на прямой проход модели LTX2 для применения по-модальных коэффициентов масштабирования внимания. Он также снижает пиковое использование VRAM по сравнению с непатченным прямым проходом. Используйте его для точной настройки влияния потоков внимания видео и аудио во время генерации.
Inputs
-
model(MODEL, обязательно) – Модель LTX2 для наложения патча. Должна быть совместимая модель, загруженная в ComfyUI. -
blocks(СТРОКА, обязательно, по умолчанию:"") – Список индексов блоков трансформера, разделённых запятыми, к которым применяется патч. Оставьте пустым, чтобы применить ко всем блокам. Пример:"0,2,4"наложит патч только на блоки 0, 2 и 4. -
video_scale(ПЛАВАЮЩИЙ, по умолчанию:1.0, диапазон:0.0–100.0, шаг0.01) – Коэффициент масштабирования для внимания видео-к-видео (самовнимание в модальности видео). -
audio_scale(ПЛАВАЮЩИЙ, по умолчанию:1.0, диапазон:0.0–100.0, шаг0.01) – Коэффициент масштабирования для внимания аудио-к-аудио (самовнимание в модальности аудио). -
audio_to_video_scale(ПЛАВАЮЩИЙ, по умолчанию:1.0, диапазон:0.0–100.0, шаг0.01) – Коэффициент масштабирования для кросс-внимания от аудио к видео. Управляет тем, насколько аудио-информация влияет на представление видео. (Подсказка: «Коэффициент масштабирования для внимания видео.»: вероятно, сокращение для эффекта на видео-внимание от аудио.) -
video_to_audio_scale(ПЛАВАЮЩИЙ, по умолчанию:1.0, диапазон:0.0–100.0, шаг0.01) – Коэффициент масштабирования для кросс-внимания от видео к аудио. Управляет тем, насколько видео-информация влияет на представление аудио. (Подсказка: «Коэффициент масштабирования для внимания аудио.»: соответствующее сокращение.) -
triton_kernels(БУЛЕВО, по умолчанию:True) – Если включено, использует объединённые ядра Triton для операций нормы+масштабирования+сдвига и RoPE. Это может быть очень немного быстрее, но требует совместимой среды с установленным Triton. Отключите, если возникают ошибки или вы предпочитаете чистый резервный вариант на PyTorch.
Outputs
MODEL– Модель LTX2 с наложенным патчем, с применёнными модификациями масштабирования внимания.
Usage Notes
- Этот узел является экспериментальным. Сделайте резервные копии ваших рабочих процессов и тщательно тестируйте, прежде чем полагаться на результаты.
- Поскольку узел модифицирует прямой проход, патченная модель будет использовать пользовательскую реализацию внимания, которая снижает пиковое потребление VRAM - полезно для более крупных генераций или при ограниченной памяти.
- Вход
blocksпозволяет выборочно патчить только определённые блоки трансформера. Это может помочь изолировать эффекты или уменьшить влияние патча на производительность. - Все коэффициенты масштабирования действуют как множители необработанных логитов внимания перед softmax. Значение
1.0оставляет внимание без изменений; значения >1.0усиливают вклад этой модальности, значения <1.0ослабляют его. - Четыре коэффициента масштабирования (видео, аудио, аудио→видео, видео→аудио) дают вам независимый контроль над внутри-модальным и кросс-модальным вниманием. Например, чтобы сделать генерацию видео более чувствительной к аудиодорожке, увеличьте
audio_to_video_scale. - Если вам не нужны корректировки кросс-модальности, оставьте
audio_to_video_scaleиvideo_to_audio_scaleна1.0и изменяйте толькоvideo_scaleиaudio_scale. - Опцию
triton_kernelsобычно можно оставить включённой; она лишь немного ускоряет патченный прямой проход. Отключите, если Triton не установлен или вызывает проблемы совместимости.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.