KJNodes/wangenerated

Патч WanVideo для эффективного использования памяти Sage Attention(WanVideoMemoryEfficientSageAttentionPatch)

ЭКСПЕРИМЕНТАЛЬНО! Активирует кастомный sageattention в self-attention WanVideo для снижения VRAM. Требуется последняя версия sageattention.

Wan Video Memory Efficient Sage Attention Patch

model
model
KJNodes

Описание

Экспериментальная нода, которая патчит механизм самовнимания WanVideo для использования пользовательской реализации sageattention, снижая пиковое использование VRAM во время вывода. Эта нода переопределяет режим внимания модели.

Требуется последняя версия `sageattention : убедитесь, что она установлена, совместима и обновлена перед использованием этой ноды.


Входы

ИмяТипОписание
modelMODELМодель WanVideo, к которой применяется патч sageattention для экономии памяти.

Выходы

ТипОписание
MODELТот же экземпляр модели с исправленным механизмом самовнимания для использования sageattention.

Примечания по использованию

  • Эта нода экспериментальная : поведение может измениться в будущих версиях.
  • Она влияет только на слои самовнимания WanVideo; перекрестное внимание и другие компоненты остаются без изменений.
  • Патч применяется как обертка модели; выход MODEL можно напрямую использовать в последующих нодах выборки.
  • Если sageattention не установлено или устарело, во время выполнения будет вызвана ошибка.
  • Применение этого патча может изменить качество или поведение вывода : тщательно тестируйте с вашим конкретным рабочим процессом.

Установка (SageAttention)

Эта опция требует установки библиотеки SageAttention в Python-окружение вашего ComfyUI:

  • Официальный репозиторий (Linux): thu-ml/SageAttention - pip install sageattention (требуется python>=3.9, torch>=2.3.0, triton>=3.0.0, CUDA>=12.0; требования к версиям см. в README)
  • Windows: woct0rdho/SageAttention - готовые wheel-файлы для Windows; сначала установите triton-windows, затем выберите wheel на странице релизов, соответствующий вашей версии PyTorch (см. README)

Для встроенного глобального ускорения ComfyUI (без узла) запустите ComfyUI с флагом --use-sage-attention. Если некоторые модели (например, Wan, Qwen-Image) дают чёрный или зашумлённый вывод из-за переполнения при квантовании, используйте sageattn_qk_int8_pv_fp16_cuda (наименее склонен к переполнению) или настройте pv_accum_dtype.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…