KJNodes/ltxvgenerated

LTX2 内存高效 Sage Attention 补丁(LTX2MemoryEfficientSageAttentionPatch)

实验性!激活自定义 sageattention 以减少峰值 VRAM 使用,覆盖注意力模式。需要最新的 sageattention 版本。

LTX2 Memory Efficient Sage Attention Patch

model
model
triton_kernels
KJNodes

描述

实验性!此节点激活自定义 sageattention 补丁以减少峰值 VRAM 使用。它会覆盖模型中当前的注意力模式,替换为内存高效的 sageattention 内核。需要最新版本的 sageattention 库。

输入

  • model (MODEL, 必填)
    将应用内存高效注意力补丁的扩散模型。

  • triton_kernels (BOOLEAN, 必填, 默认: )
    启用时,使用 Triton 融合 RoPE 内核进行自注意力 Q/K 投影。这可以进一步减少内存并提升性能,但需要安装 Triton。

输出

  • MODEL
    其注意力模式已打上 sageattention 补丁的同一模型,可供推理使用,VRAM 使用更低。

使用说明

  • 此节点是实验性的——行为在将来版本中可能发生变化。
  • 确保已安装最新的 sageattention 包(例如 pip install sageattention --upgrade)。
  • 启用 triton_kernels 需要环境中可用 Triton。如果 Triton 未安装,请将此输入设置为
  • 该补丁会覆盖模型内置的注意力机制;它将影响模型中的所有注意力图层。
  • 通常与 LTX2 系列工作流结合使用,以减少采样过程中的 VRAM 峰值。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
LTX2 内存高效 Sage Attention 补丁 (LTX2MemoryEfficientSageAttentionPatch) - ComfyUI-KJNodes | ComfyUI Wiki