KJNodes/wangenerated
WanVideo 内存高效 Sage Attention 补丁(WanVideoMemoryEfficientSageAttentionPatch)
实验性!激活 WanVideo 自注意力上的自定义 sageattention,以降低峰值 VRAM 使用,覆盖注意力模式。需要最新版 sageattention。
Wan Video Memory Efficient Sage Attention Patch
model
model
KJNodes
描述
一个实验性节点,用于修补 WanVideo 的自注意力机制,使用自定义 sageattention 实现,从而在推理期间降低峰值 VRAM 使用。此节点会覆盖模型的注意力模式。
需要最新版 sageattention – 使用此节点前请确保已安装、兼容且版本最新。
输入
| 名称 | 类型 | 描述 |
|---|---|---|
model | MODEL | 应用了内存高效 sageattention 补丁的 WanVideo 模型。 |
输出
| 类型 | 描述 |
|---|---|
MODEL | 同一模型实例,其自注意力机制已被修补为使用 sageattention。 |
使用说明
- 此节点为实验性 – 行为在后续版本中可能发生变化。
- 仅影响 WanVideo 的自注意力图层;交叉注意力或其他组件保持不变。
- 补丁以模型包装器的形式应用;输出的
MODEL可直接用于后续的采样节点。 - 如果
sageattention未安装或版本过旧,运行时将抛出错误。 - 运行此补丁可能会改变输出质量或行为 – 请针对特定的工作流仔细测试。
安装(SageAttention)
此选项需要在你 ComfyUI 的 Python 环境中安装 SageAttention 库:
- 官方仓库(Linux): thu-ml/SageAttention -
pip install sageattention(要求python>=3.9、torch>=2.3.0、triton>=3.0.0、CUDA>=12.0;版本要求见 README) - Windows: woct0rdho/SageAttention - 提供 Windows 预编译 wheel;先安装 triton-windows,再从 releases 页面 选择匹配你 PyTorch 版本的 wheel(见 README)
如需 ComfyUI 内置的全局加速(无需节点),启动 ComfyUI 时加上 --use-sage-attention。如果某些模型(如 Wan、Qwen-Image)因量化溢出产生黑图或噪点,请使用 sageattn_qk_int8_pv_fp16_cuda(最不易溢出),或调整 pv_accum_dtype。
评论
使用 GitHub 登录后即可参与讨论。