描述
基于指定的时间范围为视频和音频Latent创建噪波遮罩。已生成的遮罩指示在采样过程中应重新生成哪些时间区域:新内容在遮罩区域内产生,同时保留未更改的区域。这可用于对视频Latent或音频Latent序列进行局部编辑,例如替换特定片段同时保持其余部分不变。
输入
| 名称 | 类型 | 必填 | 默认值 | 最小值/最大值/步长 | 描述 |
|---|---|---|---|---|---|
video_latent | LATENT | 否 | – | – | 可选的视频Latent,将向其添加噪波遮罩。 |
audio_latent | LATENT | 否 | – | – | 可选的音频Latent,将向其添加噪波遮罩。 |
video_fps | FLOAT | 是 | 25 | 0 / 100 / 0.01 | 视频Latent的帧率,用于将时间(秒)转换为帧索引。 |
video_start_time | FLOAT | 是 | 0 | 0 / 10000 / 0.01 | 视频遮罩的起始时间(秒)。 |
video_end_time | FLOAT | 是 | 5 | 0 / 10000 / 0.01 | 视频遮罩的结束时间(秒)。 |
audio_start_time | FLOAT | 是 | 0 | 0 / 10000 / 0.01 | 音频遮罩的起始时间(秒)。 |
audio_end_time | FLOAT | 是 | 5 | 0 / 10000 / 0.01 | 音频遮罩的结束时间(秒)。 |
max_length | COMBO | 是 | truncate | – | 如何处理输出Latent的总长度: • truncate – 将Latent精确剪切到end_time长度• pad – 如果Latent较短,则将其扩展到end_time长度• partial – 在现有Latent内为时间范围创建遮罩,不更改其总长度 |
existing_mask_mode | COMBO | 否 | add | – | 如何与输入Latent中已存在的噪波遮罩组合: • add – 取现有遮罩和新遮罩的最大值(并集)• overwrite – 用新遮罩完全替换现有遮罩• subtract – 将遮罩区域设置为0而非1,有效取消遮罩该区域 |
输出
| 类型 | 描述 |
|---|---|
LATENT | 应用了已更新噪波遮罩(或新创建的遮罩)的视频Latent。如果未提供video_latent,则返回仅包含遮罩(无样本)的Latent批处理。 |
LATENT | 应用了已更新噪波遮罩(或新创建的遮罩)的音频Latent。如果未提供audio_latent,则返回仅包含遮罩的Latent批处理。 |
两个输出均为标准ComfyUI Latent字典,包含noise_mask键。该遮罩是一个二元张量,其中1表示需要重新生成的区域,0表示需要保留的区域。
使用说明
- 必须至少连接
video_latent或audio_latent中的一个。如果只提供一个,只有对应的输出会包含有效的样本数据;另一个输出将是一个仅包含遮罩的Latent。 - 时间值以秒为单位,并使用提供的
video_fps转换为帧索引。此转换假设Latent的时间维度对应于给定帧率下的(帧数)。对于音频Latent,使用相同的帧率值将遮罩与音频Latent的时间结构对齐。 max_length设置决定是否调整输出Latent的大小(截断或填充)以匹配指定的结束时间。在partial模式下,Latent保留其原始长度,遮罩仅覆盖请求的范围。- 当输入Latent已包含
noise_mask(例如来自前面的节点)时,existing_mask_mode控制新遮罩如何与其合并。默认的add适用于构建累积遮罩区域;overwrite完全替换遮罩;subtract可用于“擦除”先前遮罩的区域。 - 此节点旨在用于基于LTXV的模型,属于ComfyUI中的
KJNodes/ltxv类别。
评论
使用 GitHub 登录后即可参与讨论。