YuE2-3B:MAP 开源的带可编辑乐谱音乐生成模型

ComfyUI Wikinews

MAP 团队发布 YuE2-3B,这是一款开源音乐模型,凭借可编辑的旋律与和弦乐谱在 WildSongBench 上超越 Suno v5。ComfyUI 原生支持已在 yue2 分支上线。

Multimodal Art Projection (m-a-p) 团队已开源 YuE2-3B,这是一个 3B 音乐生成模型,可将歌词和风格提示转化为带人声与伴奏的完整歌曲。与典型的歌词到歌曲系统不同,YuE2 暴露了一个可编辑的乐谱层:旋律与和弦会以符号化方案的形式写下,你可以在渲染之前修改它们。在该团队的 WildSongBench 评测中,它的得分超过 Suno v5。ComfyUI 现已在 yue2 分支上提供 原生 YuE2 支持PR #16250)。

概述

YuE2-3B 是原始 YuE 歌词到歌曲模型的继任者。团队将其定位为前沿质量的开源音乐生成:在 192 条 WildSongBench 提示上,采用 best-of-8 采样的 YuE2 达到 SongBench 平均分 6.9632,而 Suno v5 为 6.8721,是全部受评测的开源与专有模型中最高的。

YuE2 在 WildSongBench 上的歌曲质量与文本对齐

在 192 条 WildSongBench 提示上的前沿歌曲质量与文本对齐。YuE2 使用符号化规划;Bo8 表示 best-of-8。

最亮眼的特性是带可编辑乐谱的符号化规划。YuE2 不会从文本直接跳到音频,而是先写出包含旋律与和弦(ABC 记谱法)的方案,再据此渲染音频。由于该方案是显式的,你可以:

  • 作曲与编辑:完整旋律加和弦、仅旋律,或不使用乐谱直接生成
  • 自带乐谱:输入已有的 ABC 乐谱,让 YuE2 演唱它
  • 用智能体编辑:把音乐反馈转化为乐谱、风格和歌词的修改,然后让模型渲染下一版本。团队演示了一条 14 个版本的编辑链,把一首歌从华语流行改到英语爵士。

架构

YuE2 架构

一个 AR–NAR Mixture-of-Transformers 主干写出乐谱和语义 token,然后通过 flow matching 生成声学 latent。VAE 将它们转换为立体声音频。

YuE2 使用 AR–NAR Mixture-of-Transformers 主干。自回归阶段规划乐谱与语义 token;非自回归阶段通过 flow matching 生成声学 latent,再由专用 VAE 解码为 48 kHz 立体声音频。规划与合成 API 分别对外暴露,因此开发者可以检查或替换符号化方案。

输出示例

模型卡片附带了涵盖原创作品与翻唱的完整时长演示:

示例风格时长
Cyber Metal英文赛博金属5:00
今晚不眠华语 funk / nu-disco3:24
Passion英文摇滚3:55
Auld Lang Syne爵士放克翻唱3:10
最炫民族风抒情歌翻唱4:45
Jingle Bells重金属翻唱1:09

这些翻唱示例展示了模型如何用完全不同的曲风重新演绎一首既有歌曲,而智能体编辑演示则完整走过了同一首歌的 9 个规划步骤和 14 个渲染版本。

运行方式

YuE2-3B 可在 24 GB NVIDIA GPU(Linux、Python 3.10+)上本地运行,无需量化。团队在 Hugging Face 上发布了推理 wheel 以及 7.3 GB 的 checkpoint:

python -m pip install huggingface-hub==0.36.2
hf download m-a-p/YuE2-3B yue2_infer-0.1.5-py3-none-any.whl --local-dir .
python -m pip install ./yue2_infer-0.1.5-py3-none-any.whl

该 pipeline 暴露了 Hugging Face 加载、文本引导(CFG)以及独立的规划与合成 API。完整 notebook 以及翻唱/编辑配方都在 README 中。

可用性

目前还没有原生 ComfyUI 支持。长期存在的社区节点 ComfyUI_YuE 在 ComfyUI 中封装了 YuE 系列;截至撰写时它尚未针对 YuE2 更新,因此今天运行 YuE2-3B 需要官方的 Python 推理包。托管演示可在项目主页获取。

原生 ComfyUI 支持已登陆 yue2 分支

9 月 11 日,ComfyUI 核心在 PR #16250 中加入了原生 YuE2 支持。截至撰写时,它位于独立的 yue2 分支而非 master 上,因此你需要检出该分支(commit d87e12ad)才能试用。Comfy-Org 的 Hugging Face 账号上发布了开箱即用的一体化 checkpointyue2.safetensors,7.8 GB),并且该 pull request 附有一个测试工作流。

来自原生分支的早期渲染听起来还不错,但该集成仍是第一天的新鲜事物:

  • YuE2 固定了 PyTorch、Transformers 和其他共享依赖项的确切版本,因此安装独立的 YuE2 依赖项可能会覆盖 ComfyUI 所需的包。原生分支避免了多 venv 问题,但设置完成后请检查你的环境。
  • 社区节点包,例如 EmeraldApple-AI/ComfyUI-YuE2 和一个隔离 YuE2 wheel 的 ScryptHunter fork,也在一天之内出现;它们目前仍是实验性的个人项目。
  • YuE2 自带的 VAE 只能在连续声学 latent 之间转换音频,这意味着 YuE2 的 LoRA 训练目前尚不可行:离散的语义音乐 token 和 YuE2 专用的训练 pipeline 尚未发布。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
YuE2-3B:MAP 开源的带可编辑乐谱音乐生成模型 | ComfyUI Wiki