描述
实验性! 此节点为LTX2模型的前向传播打补丁,以按模态应用注意力缩放因子。与未打补丁的前向传播相比,还能降低峰值显存使用。使用它来微调生成过程中视频和音频注意力流的影响力。
输入
-
model(MODEL, 必填) – 待打补丁的LTX2模型。必须是ComfyUI中已加载的兼容模型。 -
blocks(STRING, 必填, 默认值:"") – 以逗号分隔的Transformer块索引列表,用于指定应用补丁的块。留空则应用于所有块。示例:"0,2,4"将只给块0、2和4打补丁。 -
video_scale(FLOAT, 默认值:1.0, 范围:0.0–100.0, 步长0.01) – 视频到视频注意力(视频模态内的自注意力)的缩放因子。 -
audio_scale(FLOAT, 默认值:1.0, 范围:0.0–100.0, 步长0.01) – 音频到音频注意力(音频模态内的自注意力)的缩放因子。 -
audio_to_video_scale(FLOAT, 默认值:1.0, 范围:0.0–100.0, 步长0.01) – 音频到视频的交叉注意力缩放因子。控制音频信息对视频表示的影响程度。(工具提示:视频注意力的缩放因子。– 可能是描述音频对视频注意力影响的简写。) -
video_to_audio_scale(FLOAT, 默认值:1.0, 范围:0.0–100.0, 步长0.01) – 视频到音频的交叉注意力缩放因子。控制视频信息对音频表示的影响程度。(工具提示:音频注意力的缩放因子。– 对应的简写。) -
triton_kernels(BOOLEAN, 默认值:是) – 启用时,使用Triton融合内核进行归一化+缩放+移位以及RoPE应用操作。这可以略微提高速度,但需要安装了Triton的兼容环境。如果遇到错误或希望使用纯PyTorch回退,则禁用此选项。
输出
MODEL– 应用了注意力缩放修改后的LTX2模型(已打补丁)。
使用说明
- 此节点为实验性功能。请备份工作流并在依赖结果前进行充分测试。
- 由于节点修改了前向传播,打补丁后的模型将使用自定义注意力实现,从而降低峰值显存消耗——对于更大规模的生成或内存受限的情况非常有用。
blocks输入允许你选择性地仅给某些Transformer块打补丁。这有助于隔离效果或减少补丁的性能影响。- 所有缩放因子作为原始注意力logits在softmax之前的乘数。值为
1.0时注意力保持不变;值 >1.0会放大该模态的贡献;值 <1.0则会削弱。 - 四个缩放因子(视频、音频、音频→视频、视频→音频)使你能够独立控制模态内和跨模态注意力。例如,要使视频生成对音频轨道更敏感,可增加
audio_to_video_scale。 - 如果不需要跨模态调整,请将
audio_to_video_scale和video_to_audio_scale保持为1.0,仅调整video_scale和audio_scale。 triton_kernels选项通常可以安全地保持启用;它只会略微加速打补丁后的前向传播。如果Triton未安装或导致兼容性问题,请禁用。
评论
使用 GitHub 登录后即可参与讨论。