ACE-Step 1.5:开源音乐生成,提供官方 ComfyUI 支持

ComfyUI Wikinews

ACE Studio 与 StepFun 发布 ACE-Step 1.5,这是一款开源音乐基础模型,可在消费级 GPU 上于数秒内生成完整歌曲,并提供官方 Comfy-Org 文件与工作流。

ACE-Step 1.5 是由 ACE Studio 与 StepFun 推出的开源音乐基础模型,可将文本提示词转化为完整歌曲,从短循环到 10 分钟的长篇作品均可生成,速度快到足以在消费级硬件上运行。Turbo 变体在 A100 上不到 2 秒即可生成完整歌曲,在 RTX 3090 上不到 10 秒,本地运行所需显存低于 4GB。

ACE-Step 1.5

混合 LM + DiT 架构

ACE-Step 1.5 将基于 Qwen 千问的语言模型(0.6B / 1.7B / 4B)与 diffusion transformer 相结合。LM 充当全能规划器:它可将用户的简单查询转化为全面的歌曲蓝图,其中结构、元数据、歌词和文本描述均通过思维链生成,用于指导 DiT。这种对齐通过内在强化学习实现,无需外部奖励模型或人类偏好数据。

ACE-Step 1.5 架构

除合成功能外,该模型还将风格控制与编辑能力集于一体,支持翻唱生成、重绘和人声转 BGM 等功能,同时可在 50 多种语言中保持出色的提示词遵循度。该系列提供四种 DiT 变体:basesftturbo(8 步蒸馏)和 turbo-rl,并搭配三种 LM 规模:

ACE-Step 1.5 模型库 ACE-Step 1.5 评估

官方 ComfyUI 支持

Comfy-Org 为 ACE-Step 1.5 维护了官方 ComfyUI 文件,包括一体化 Turbo checkpoint、拆分 diffusion 模型(Base / Turbo / XL 变体)、Qwen 千问文本编码器和 VAE,并提供了逐步操作的 docs.comfy.org 教程。官方工作流模板位于 Comfy-Org workflow_templates 仓库中:

获取方式

模型权重已发布在 Hugging FaceModelScope 上,同时提供交互式 Space 演示 以及 arXiv 上的技术报告

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
ACE-Step 1.5:开源音乐生成,提供官方 ComfyUI 支持 | ComfyUI Wiki