KJNodes/ltxvgenerated

Патч экономии памяти Sage Attention для LTX2(LTX2MemoryEfficientSageAttentionPatch)

ЭКСПЕРИМЕНТАЛЬНО! Активирует пользовательское sageattention для снижения пикового использования VRAM, переопределяет режим внимания. Требуется последняя версия sageattention.

LTX2 Memory Efficient Sage Attention Patch

model
model
triton_kernels
KJNodes

Описание

ЭКСПЕРИМЕНТАЛЬНО! Этот узел активирует пользовательский патч sageattention для снижения пикового использования VRAM. Он переопределяет текущий режим внимания в модели, заменяя его на ядра sageattention, экономящие память. Требуется последняя версия библиотеки sageattention.

Входы

  • model (MODEL, обязательно)
    Модель диффузии, к которой будет применен патч внимания, экономящий память.

  • triton_kernels (BOOLEAN, обязательно, по умолчанию: истина)
    При включении использует объединенные ядра Triton RoPE для проекций Q/K самовнимания. Это может дополнительно снизить использование памяти и повысить производительность, но требует установки Triton.

Выходы

  • MODEL
    Та же модель с пропатченным режимом внимания для использования sageattention, готовая к выводу с меньшим потреблением VRAM.

Примечания по использованию

  • Этот узел является экспериментальным: его поведение может измениться в будущих версиях.
  • Убедитесь, что у вас установлена последняя версия пакета sageattention (например, pip install sageattention --upgrade).
  • Включение triton_kernels требует наличия Triton в вашей среде. Если Triton не установлен, установите этот вход в значение ложь.
  • Патч переопределяет встроенный механизм внимания модели; он затронет все слои внимания в модели.
  • Обычно используется в сочетании с рабочими процессами семейства LTX2 для снижения пиков VRAM во время выборки.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Патч экономии памяти Sage Attention для LTX2 (LTX2MemoryEfficientSageAttentionPatch) - ComfyUI-KJNodes | ComfyUI Wiki