KJNodes/deprecatedgenerated
Create Audio Mask(CreateAudioMask)
该节点通过加载指定路径的 WAV 音频文件,使用 librosa 库计算其短时傅里叶变换以获取频谱数据
Create Audio Mask
IMAGE
invert
frames
16
scale
0.50
audio_path
audio.wav
width
256
height
256
KJNodes
弃用: 此节点已弃用,并移至 KJNodes/deprecated 类别。它可能在未来的更新中被移除。请考虑使用其他节点来实现音频驱动的遮罩生成。
Create Audio Mask 节点从指定路径加载 WAV 音频文件,并使用 librosa 库计算其短时傅里叶变换 (STFT) 以获取频谱数据。
Create Audio Mask 节点能够根据音频文件的频谱信息动态生成一系列图像遮罩。其核心功能是将音频中的振幅变化转化为一系列可视化圆形遮罩,为后续的图像处理或视频合成提供与音频节奏同步的视觉元素。
节点功能
此节点从指定路径加载 WAV 音频文件,并使用 librosa 库计算其短时傅里叶变换 (STFT) 以获取频谱数据。根据设定的帧数,节点从频谱中提取对应时间段的平均振幅。然后将此振幅值乘以缩放系数来计算圆形的半径。最后,在指定尺寸的画布中心生成一个白色圆形图像(反转后为黑色圆形图像)。
节点参数说明 - Create Audio Mask
控件参数 (Parameters)
| 参数名称 | 数据类型 | 必填 | 默认值 | 取值范围/选项 | 说明 |
|---|---|---|---|---|---|
invert | BOOLEAN | 是 | False | - | invert(输入参数):反转遮罩颜色。False 时生成白底黑圆,True 时生成黑底白圆。 |
frames | INT | 是 | 16 | 1 - 255 (步长: 1) | frames(输入参数):设定要生成的图像遮罩总帧数,取值范围为 1 到 255。 |
scale | FLOAT | 是 | 0.5 | 0.0 - 2.0 (步长: 0.01) | scale(输入参数):控制圆形半径的缩放系数,取值范围为 0.0 到 2.0,步长为 0.01。 |
audio_path | STRING | 是 | audio.wav | - | audio_path(输入参数):指定输入音频文件的路径字符串,默认读取当前目录下的“audio.wav”文件。 |
width | INT | 是 | 256 | 16 - 4096 (步长: 1) | width(输入参数):设置输出遮罩图像的宽度像素值,取值范围为 16 到 4096。 |
height | INT | 是 | 256 | 16 - 4096 (步长: 1) | height(输入参数):设置输出遮罩图像的高度像素值,取值范围为 16 到 4096。 |
Output 输出
| 参数名称 | 数据类型 | 说明 |
|---|---|---|
| IMAGE | IMAGE | IMAGE(输出参数):输出生成的图像序列,为与音频频谱对应的可视化遮罩。 |
使用场景
在制作音乐可视化短片或需要音画同步特效的工作流中,此节点非常有用。你可以将生成的图像序列(遮罩)连接到图像混合或重绘区域节点,根据音乐节奏控制视频中某些元素(如光晕、粒子)出现或消失的范围,从而实现音频驱动的视觉变化。
注意事项
此节点依赖于 librosa 库,若未安装会导致运行错误。默认音频路径为“audio.wav”,若文件不在 ComfyUI 根目录下,可能需要使用绝对路径以确保节点能正确读取文件。
Create Audio Mask 节点源码链接
Create Audio Mask 节点来自 ComfyUI-KJNodes 节点包。
评论
使用 GitHub 登录后即可参与讨论。