项目详情
YuE
开源音乐生成的白盒路线:先生成可编辑的乐谱,再渲染成 48kHz 立体声完整歌曲——质量对齐 Suno
GitHub 地址
Apache-2.0 代码 · CC BY-NC 4.0 权重
7.3k Stars
Python · PyTorch
YuE2-3B
更新于 2026-09-13
← 返回汇总
项目速览
一句话定位
用符号作曲,用声音成片
开源前沿音乐生成模型(YuE2):输入歌词与风格描述,先写出旋律+和弦的可编辑乐谱计划(ABC 记谱),再渲染成带人声与伴奏的完整歌曲。同一检查点支持三件事:从零创作、零样本翻唱(转录源曲再换风格)、对话式 Agent 编辑。HKUST / M·A·P / Stanford 等 8 家机构的学术联合作品,权重开放下载,WildSongBench 上与 Suno v5/v6 同台竞争。
项目速览
核心数据
- 学术重镇联合:HKUST、M·A·P、Tokenwave.AI、NYU、Stanford、MBZUAI、NOIZ、ACE Studio——团队此前已有 MERT(音乐理解)与 YuE v1 的积累
- 一代到二代的跃迁:v1(2025-01)SongBench 4.92 → v2 6.73 / best-of-8 6.96——从「能听」到「前沿」
- 全家族开源:生成模型 + 转录(SheetSage2)+ 音乐理解(MERT2)+ 评测集全部上 Hugging Face
- 代码极轻:仓库仅 320 KB Python,权重与数据走 HF;9 位贡献者,156 commits,学术式精干
为什么存在
商业音乐 AI 全是黑箱,音乐人没法干活
一次成型,不可干预
Suno/Udio 从歌词直接出音频:旋律和弦埋在波形里,「把副歌改成大调」这种基本操作做不到,只能重抽卡。
闭源 + 订阅墙
最好的音乐模型不可下载、不可微调、商用条款随时变——对音乐工业是平台依赖。
创作需要中间表示
人类作曲的工作对象是谱:可读、可改、可交接。AI 生成若不暴露乐谱层,就进不了真实工作流。
YuE2 的答案:把乐谱作为一等公民——旋律与和弦显式生成、显式可编辑,渲染只是最后一步。
核心理念
Symbolic Planning:乐谱是白盒接口
- 两阶段而不是一阶段:先「作曲」(旋律 + 和弦的 ABC 记谱计划),后「编曲演唱」(语义 token → 声学 latent → 音频)
- 乐谱人类可读可改:导出
score.abc,改和声、移调、调整曲式后重新渲染——像改代码一样改歌
- 同一个检查点三种玩法:创作(模型自己写谱)、翻唱(转录外部谱)、编辑(人类/Agent 改谱)——差异只在「谱从哪来」
- Agent 友好:乐谱是结构化文本,Agent 能检查音乐不变量(如「保留人声旋律与歌词顺序」)再提交渲染
这是与 Suno 路线之争的本质:黑箱端到端换便捷,白盒符号规划换控制权。YuE2 证明白盒路线也能到前沿质量。
🔥 核心架构
生成管线:AR–NAR 混合 Transformer + 流匹配
核心生成链路
输入与模式入口
解码为音频
核心能力
创作 · 翻唱 · Agent 编辑
从零创作
- 歌词 + 风格 → 旋律与和弦计划 → 完整歌曲
cot="full" 默认模式
- 乐谱可读可改,渲染前先「审曲」
零样本翻唱
- 源录音 → SheetSage2 转谱 → 换风格重唱
cot="melody" 保留旋律、伴奏自由
- 948 首 CLEWS mAP 0.647(无谱仅 0.006)
Agent 对话式编辑
- 「和声改成爵士、加段萨克斯」→ 改谱 → 重渲染
- 官方 demo:一首歌 9 步对话 14 个版本
- 同一生成检查点,无需编辑专用微调
关键洞察:「可编辑」不需要第二个模型——编辑只是把改过的谱重新喂给同一条管线。这把音乐生成从「抽卡」变成了「迭代」。
硬数据
WildSongBench:开源第一,整体登顶
192 条评测 prompt · 自动评测 · 2026-09-12。SongBench Avg 综合分(越高越好);† = 开放权重,灰条 = 闭源商业系统。
原文注记:榜首间差距未达统计显著;各单项指标冠军不一(Suno v6 Wild 的 MuLan 最高、v4.5 的 PER 最低)。指标含 AudioBox 制作质量 + MuLan 文本对齐 + 发音错误率。
生态
不止生成器:全家桶各带 SOTA
| 成员 | 角色 | 成绩 |
| YuE2-3B | 歌曲生成主模型(符号规划/翻唱/编辑一体) | WildSongBench 开源最高 |
| MERT2 | 音乐理解表征(30s 与全曲两版) | MARBLE 15 项指标中 14 项 SOTA;GTZAN 流派 91.72% |
| SheetSage2 | 音频转乐谱转录(翻唱/编辑的入口) | 13 项基准中 10 项 SOTA;RWC-POP 人声旋律 F1 82.51% |
| WildSongBench | 评测集(192 prompt + 复现协议) | 开源音乐生成的公开竞技场 |
| YuE2-Vae / legacy | 两个解码器:默认听感 vs 基准协议 | — |
研究闭环完整:理解(MERT2)→ 转录(SheetSage2)→ 生成(YuE2)→ 评测(WSB)全部开放——别人做产品,这个团队顺手把学科基建也铺了。
上手
快速开始:一条管线四个阶段
# Linux · Python 3.12 · 24GB VRAM(BF16)
git clone https://github.com/multimodal-art-projection/YuE.git
cd YuE && python3.12 -m venv .venv && source .venv/bin/activate
python -m pip install .
python examples/generate.py --output outputs/first-song
# Python staged API:中间产物皆可导出
from yue2 import YuE2Pipeline
with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B",
device="cuda") as pipe:
plan = pipe.plan(**request) # 乐谱 ABC
song = pipe(**request) # 全流程
song.save_artifacts("outputs/my-song")
- 输出不只是音频:目录同时保留乐谱、语义 token、声学 latent、生成设置——可复现、可改谱重渲染
- 四种 cot 模式:
full(默认创作)/ melody(翻唱推荐)/ off(直接生成)/ abc=...(自带谱)
- 权重首次运行自动下载(Hugging Face);量化关闭,原生 48kHz 立体声
- 转谱翻唱:SheetSage2 在独立环境运行,详见 docs/covers.md
生态
官方 Agent Skill:让 AI 编曲师上岗
- skills/yue2-music:标准 SKILL.md 包,教会任意 Agent 生成歌曲、转录翻唱、编辑 ABC 谱、检查音乐不变量、组织试听对比
- 官方示例任务:「做一首英文钢琴流行曲,保留原音频与乐谱;再出第二版改爵士和声、保留人声旋律与歌词顺序,两版对比」——Agent 通过乐谱层保证约束成立
- 把「不变量检查」交给 Agent:改和声时不破坏旋律、改风格时保留歌词顺序——结构化乐谱让这些约束可验证,波形做不到
- 与学术主线一致:论文式 benchmark + 可复现协议 + Agent 工作流,工程与科研一体
对比
白盒开源 vs 黑箱商业
YuE2 的牌
- 权重可下载、可微调(个人/研究)
- 乐谱层可读可改,进真实音乐工作流
- 翻唱/编辑同一检查点,无需订阅多产品
- 评测协议公开,成绩可复现
Suno 的牌
- 零门槛:手机上 30 秒出歌
- 无需 24GB 显卡,无需 Linux
- 闭源持续迭代,商用授权打包
- 单项指标仍有领先(文本对齐、发音)
定位差异:Suno 卖「出歌的便利」,YuE2 给「做歌的控制权」。要改谱、要翻唱、要离线、要研究——只有后者可选。
风险提示
需要警惕
- 权重 CC BY-NC 4.0:代码 Apache-2.0 但模型权重禁止商用——想商用需联系作者拿授权,这是最重要的一个限制
- 硬件门槛:Linux + Python 3.12 + 24GB VRAM(BF16),Mac/Windows 无官方路径,消费级门槛不低
- 榜首差距不显著:与 Mureka/Suno 的 0.03 分差在统计噪声内,别把「登顶」读成「碾压」
- 生态早期:v0.1.6 刚发布(2026-09-09),API 可能变动;技术报告尚未发布(暂引 v1 论文)
- 版权连环雷:翻唱涉及源曲权利、训练数据权利、输出风格模仿——法律层面整个赛道都在灰色地带
潜力评估
评分:8.5 / 10 · tracking
符号规划路线第一次把开源音乐生成推到前沿质量,且理解/转录/生成/评测全链路开放。若 Agent 编辑工作流成熟 + 商用授权路径明确,可能改变音乐 AI 的生产范式。学术团队的产品化执行力是最大不确定项。