AKUSPACE: LTX-2.5 音频的声学空间 LoRA 模型与 ComfyUI 节点

ComfyUI Wikinews

KoshiMazaki 发布 AKUSPACE v0.5,这是一款针对 LTX-2.5 的空间音频 LoRA,可将已生成的语音和音乐置于房间、俱乐部、大教堂或户外环境中,并包含 ComfyUI 节点。

KoshiMazaki 发布了 AKUSPACE v0.5,这是一个针对 LTX-2.5 的空间感知音频 LoRA,赋予已生成或参考音频物理空间的声学特征:小房间、空荡的俱乐部、大教堂或户外环境。LoRA、演示网站和配套的 ComfyUI 节点包全部开源:Hugging Face | interactive demo | ComfyUI-Koshi-Nodes

AKUSPACE control surface

AKUSPACE 控制面板:来源、监听者和已选择的声学空间,下方显示训练得出的衰减时间。

功能说明

AKUSPACE 作为音频到音频适配器进行训练:它变换接收到的音频,利用房间混响、户外氛围和空间音效塑造语音、节拍和乐器。控制面板由提示驱动,触发词为 AKUSPACE,并在空间与其特征之间使用一个等级词:

AKUSPACE female spoken voice through synthetic cathedral reverb, moderate wide diffuse reflections and a long decaying tail, no background ambience
模式选项等级
空间:声音所在的房间小房间,中房间,空俱乐部,大教堂轻柔 / 中等 / 强烈
地点:声音所在的环境户外白天,户外夜晚轻柔 / 强烈
音效:声音处理经过的路径双延迟轻柔 / 强烈

户外“地点”仅能向下缩放,不能向上:氛围层是单独的录音而非混响尾音。房间标题携带衰减时间;大教堂具有颗粒效果,两个户外地点均无数值衰减。

支持的工作流

输入输出
音频对现有录音的音频到音频处理
文本 + 音频带有 AKUSPACE 处理过的同步音频的文生视频
图像 + 音频带有 AKUSPACE 处理过的同步音频的图生视频

经过验证的视频流程是干声,然后是音频到音频的空间处理,接着是图像 + 音频转视频,处理后的音频保持固定,同时图像条件化第一帧。该适配器针对音频分支;视频生成由基础 LTX-2.5 模型处理。它也可以作为配音通道运行,其时间对齐的参考使处理固定在源表演上。

关闭提示增强。重写器会改写触发词和等级词,而这正是控制面板所依赖的令牌。另外请注意,加载 LoRA 且没有参考音频时,文生音频会产生近乎静音:没有东西可以变换。

设置与用法

建议设置为 24 步,CFG 1-2,调整为 CFG 4 以获得更高的音量和细节。部分字幕不如完整字幕效果好,因为每个训练字幕中都包含尾部从句。ComfyUI 节点包附带一个 three.js 查看器,用于从场景视图操作提示:来源、监听者和空间。

可用性

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
AKUSPACE: LTX-2.5 音频的声学空间 LoRA 模型与 ComfyUI 节点 | ComfyUI Wiki