KJNodes/ltxvgenerated

LTX2注意力调谐器补丁(LTX2AttentionTunerPatch)

实验性!自定义LTX2前向传播,按模态应用注意力缩放因子,同时降低峰值显存使用。

LTX2 Attention Tuner Patch

model
model
blocks
STRING
video_scale
1.00
audio_scale
1.00
audio_to_video_scale
1.00
video_to_audio_scale
1.00
triton_kernels
KJNodes

描述

实验性! 此节点为LTX2模型的前向传播打补丁,以按模态应用注意力缩放因子。与未打补丁的前向传播相比,还能降低峰值显存使用。使用它来微调生成过程中视频和音频注意力流的影响力。

输入

  • model (MODEL, 必填) – 待打补丁的LTX2模型。必须是ComfyUI中已加载的兼容模型。

  • blocks (STRING, 必填, 默认值: "") – 以逗号分隔的Transformer块索引列表,用于指定应用补丁的块。留空则应用于所有块。示例:"0,2,4" 将只给块0、2和4打补丁。

  • video_scale (FLOAT, 默认值: 1.0, 范围: 0.0100.0, 步长 0.01) – 视频到视频注意力(视频模态内的自注意力)的缩放因子。

  • audio_scale (FLOAT, 默认值: 1.0, 范围: 0.0100.0, 步长 0.01) – 音频到音频注意力(音频模态内的自注意力)的缩放因子。

  • audio_to_video_scale (FLOAT, 默认值: 1.0, 范围: 0.0100.0, 步长 0.01) – 音频到视频的交叉注意力缩放因子。控制音频信息对视频表示的影响程度。(工具提示:视频注意力的缩放因子。 – 可能是描述音频对视频注意力影响的简写。)

  • video_to_audio_scale (FLOAT, 默认值: 1.0, 范围: 0.0100.0, 步长 0.01) – 视频到音频的交叉注意力缩放因子。控制视频信息对音频表示的影响程度。(工具提示:音频注意力的缩放因子。 – 对应的简写。)

  • triton_kernels (BOOLEAN, 默认值: ) – 启用时,使用Triton融合内核进行归一化+缩放+移位以及RoPE应用操作。这可以略微提高速度,但需要安装了Triton的兼容环境。如果遇到错误或希望使用纯PyTorch回退,则禁用此选项。

输出

  • MODEL – 应用了注意力缩放修改后的LTX2模型(已打补丁)。

使用说明

  • 此节点为实验性功能。请备份工作流并在依赖结果前进行充分测试。
  • 由于节点修改了前向传播,打补丁后的模型将使用自定义注意力实现,从而降低峰值显存消耗——对于更大规模的生成或内存受限的情况非常有用。
  • blocks输入允许你选择性地仅给某些Transformer块打补丁。这有助于隔离效果或减少补丁的性能影响。
  • 所有缩放因子作为原始注意力logits在softmax之前的乘数。值为1.0时注意力保持不变;值 > 1.0会放大该模态的贡献;值 < 1.0则会削弱。
  • 四个缩放因子(视频、音频、音频→视频、视频→音频)使你能够独立控制模态内和跨模态注意力。例如,要使视频生成对音频轨道更敏感,可增加audio_to_video_scale
  • 如果不需要跨模态调整,请将audio_to_video_scalevideo_to_audio_scale保持为1.0,仅调整video_scaleaudio_scale
  • triton_kernels选项通常可以安全地保持启用;它只会略微加速打补丁后的前向传播。如果Triton未安装或导致兼容性问题,请禁用。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
LTX2注意力调谐器补丁 (LTX2AttentionTunerPatch) - ComfyUI-KJNodes | ComfyUI Wiki