AKUSPACE: LTX-2.5 音频的声学空间 LoRA 模型与 ComfyUI 节点
ComfyUI Wikinews
KoshiMazaki 发布 AKUSPACE v0.5,这是一款针对 LTX-2.5 的空间音频 LoRA,可将已生成的语音和音乐置于房间、俱乐部、大教堂或户外环境中,并包含 ComfyUI 节点。
KoshiMazaki 发布了 AKUSPACE v0.5,这是一个针对 LTX-2.5 的空间感知音频 LoRA,赋予已生成或参考音频物理空间的声学特征:小房间、空荡的俱乐部、大教堂或户外环境。LoRA、演示网站和配套的 ComfyUI 节点包全部开源:Hugging Face | interactive demo | ComfyUI-Koshi-Nodes。
AKUSPACE 控制面板:来源、监听者和已选择的声学空间,下方显示训练得出的衰减时间。
功能说明
AKUSPACE 作为音频到音频适配器进行训练:它变换接收到的音频,利用房间混响、户外氛围和空间音效塑造语音、节拍和乐器。控制面板由提示驱动,触发词为 AKUSPACE,并在空间与其特征之间使用一个等级词:
AKUSPACE female spoken voice through synthetic cathedral reverb, moderate wide diffuse reflections and a long decaying tail, no background ambience| 模式 | 选项 | 等级 |
|---|---|---|
| 空间:声音所在的房间 | 小房间,中房间,空俱乐部,大教堂 | 轻柔 / 中等 / 强烈 |
| 地点:声音所在的环境 | 户外白天,户外夜晚 | 轻柔 / 强烈 |
| 音效:声音处理经过的路径 | 双延迟 | 轻柔 / 强烈 |
户外“地点”仅能向下缩放,不能向上:氛围层是单独的录音而非混响尾音。房间标题携带衰减时间;大教堂具有颗粒效果,两个户外地点均无数值衰减。
支持的工作流
| 输入 | 输出 |
|---|---|
| 音频 | 对现有录音的音频到音频处理 |
| 文本 + 音频 | 带有 AKUSPACE 处理过的同步音频的文生视频 |
| 图像 + 音频 | 带有 AKUSPACE 处理过的同步音频的图生视频 |
经过验证的视频流程是干声,然后是音频到音频的空间处理,接着是图像 + 音频转视频,处理后的音频保持固定,同时图像条件化第一帧。该适配器针对音频分支;视频生成由基础 LTX-2.5 模型处理。它也可以作为配音通道运行,其时间对齐的参考使处理固定在源表演上。
关闭提示增强。重写器会改写触发词和等级词,而这正是控制面板所依赖的令牌。另外请注意,加载 LoRA 且没有参考音频时,文生音频会产生近乎静音:没有东西可以变换。
设置与用法
建议设置为 24 步,CFG 1-2,调整为 CFG 4 以获得更高的音量和细节。部分字幕不如完整字幕效果好,因为每个训练字幕中都包含尾部从句。ComfyUI 节点包附带一个 three.js 查看器,用于从场景视图操作提示:来源、监听者和空间。
可用性
- LoRA 权重:KoshiMazaki/akuspace-ltx25 在 LTX-2 社区许可证下
- ComfyUI 节点:koshimazaki/ComfyUI-Koshi-Nodes
- 交互式视听研究:akuspace.pages.dev
评论
使用 GitHub 登录后即可参与讨论。