KJNodes/deprecatedgenerated

Create Audio Mask(CreateAudioMask)

该节点通过加载指定路径的 WAV 音频文件,使用 librosa 库计算其短时傅里叶变换以获取频谱数据

Create Audio Mask

IMAGE
invert
frames
16
scale
0.50
audio_path
audio.wav
width
256
height
256
KJNodes

弃用: 此节点已弃用,并移至 KJNodes/deprecated 类别。它可能在未来的更新中被移除。请考虑使用其他节点来实现音频驱动的遮罩生成。

Create Audio Mask 节点从指定路径加载 WAV 音频文件,并使用 librosa 库计算其短时傅里叶变换 (STFT) 以获取频谱数据。

Create Audio Mask 节点能够根据音频文件的频谱信息动态生成一系列图像遮罩。其核心功能是将音频中的振幅变化转化为一系列可视化圆形遮罩,为后续的图像处理或视频合成提供与音频节奏同步的视觉元素。

节点功能

此节点从指定路径加载 WAV 音频文件,并使用 librosa 库计算其短时傅里叶变换 (STFT) 以获取频谱数据。根据设定的帧数,节点从频谱中提取对应时间段的平均振幅。然后将此振幅值乘以缩放系数来计算圆形的半径。最后,在指定尺寸的画布中心生成一个白色圆形图像(反转后为黑色圆形图像)。

节点参数说明 - Create Audio Mask

控件参数 (Parameters)

参数名称数据类型必填默认值取值范围/选项说明
invertBOOLEANFalse-invert(输入参数):反转遮罩颜色。False 时生成白底黑圆,True 时生成黑底白圆。
framesINT161 - 255 (步长: 1)frames(输入参数):设定要生成的图像遮罩总帧数,取值范围为 1 到 255。
scaleFLOAT0.50.0 - 2.0 (步长: 0.01)scale(输入参数):控制圆形半径的缩放系数,取值范围为 0.0 到 2.0,步长为 0.01。
audio_pathSTRINGaudio.wav-audio_path(输入参数):指定输入音频文件的路径字符串,默认读取当前目录下的“audio.wav”文件。
widthINT25616 - 4096 (步长: 1)width(输入参数):设置输出遮罩图像的宽度像素值,取值范围为 16 到 4096。
heightINT25616 - 4096 (步长: 1)height(输入参数):设置输出遮罩图像的高度像素值,取值范围为 16 到 4096。

Output 输出

参数名称数据类型说明
IMAGEIMAGEIMAGE(输出参数):输出生成的图像序列,为与音频频谱对应的可视化遮罩。

使用场景

在制作音乐可视化短片或需要音画同步特效的工作流中,此节点非常有用。你可以将生成的图像序列(遮罩)连接到图像混合或重绘区域节点,根据音乐节奏控制视频中某些元素(如光晕、粒子)出现或消失的范围,从而实现音频驱动的视觉变化。

注意事项

此节点依赖于 librosa 库,若未安装会导致运行错误。默认音频路径为“audio.wav”,若文件不在 ComfyUI 根目录下,可能需要使用绝对路径以确保节点能正确读取文件。

Create Audio Mask 节点源码链接

Create Audio Mask 节点来自 ComfyUI-KJNodes 节点包。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…