描述
实验性!此节点激活自定义 sageattention 补丁以减少峰值 VRAM 使用。它会覆盖模型中当前的注意力模式,替换为内存高效的 sageattention 内核。需要最新版本的 sageattention 库。
输入
-
model (
MODEL, 必填)
将应用内存高效注意力补丁的扩散模型。 -
triton_kernels (
BOOLEAN, 必填, 默认:是)
启用时,使用 Triton 融合 RoPE 内核进行自注意力 Q/K 投影。这可以进一步减少内存并提升性能,但需要安装 Triton。
输出
MODEL
其注意力模式已打上 sageattention 补丁的同一模型,可供推理使用,VRAM 使用更低。
使用说明
- 此节点是实验性的——行为在将来版本中可能发生变化。
- 确保已安装最新的
sageattention包(例如pip install sageattention --upgrade)。 - 启用
triton_kernels需要环境中可用 Triton。如果 Triton 未安装,请将此输入设置为否。 - 该补丁会覆盖模型内置的注意力机制;它将影响模型中的所有注意力图层。
- 通常与
LTX2系列工作流结合使用,以减少采样过程中的 VRAM 峰值。
评论
使用 GitHub 登录后即可参与讨论。