Описание
ЭКСПЕРИМЕНТАЛЬНО! Этот узел активирует пользовательский патч sageattention для снижения пикового использования VRAM. Он переопределяет текущий режим внимания в модели, заменяя его на ядра sageattention, экономящие память. Требуется последняя версия библиотеки sageattention.
Входы
-
model (
MODEL, обязательно)
Модель диффузии, к которой будет применен патч внимания, экономящий память. -
triton_kernels (
BOOLEAN, обязательно, по умолчанию:истина)
При включении использует объединенные ядра Triton RoPE для проекций Q/K самовнимания. Это может дополнительно снизить использование памяти и повысить производительность, но требует установки Triton.
Выходы
MODEL
Та же модель с пропатченным режимом внимания для использования sageattention, готовая к выводу с меньшим потреблением VRAM.
Примечания по использованию
- Этот узел является экспериментальным: его поведение может измениться в будущих версиях.
- Убедитесь, что у вас установлена последняя версия пакета
sageattention(например,pip install sageattention --upgrade). - Включение
triton_kernelsтребует наличия Triton в вашей среде. Если Triton не установлен, установите этот вход в значениеложь. - Патч переопределяет встроенный механизм внимания модели; он затронет все слои внимания в модели.
- Обычно используется в сочетании с рабочими процессами семейства
LTX2для снижения пиков VRAM во время выборки.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.