项目详情

YuE

开源音乐生成的白盒路线:先生成可编辑的乐谱,再渲染成 48kHz 立体声完整歌曲——质量对齐 Suno

GitHub 地址 Apache-2.0 代码 · CC BY-NC 4.0 权重 7.3k Stars Python · PyTorch YuE2-3B

更新于 2026-09-13

← 返回汇总
项目速览

一句话定位

用符号作曲,用声音成片

开源前沿音乐生成模型(YuE2):输入歌词与风格描述,先写出旋律+和弦的可编辑乐谱计划(ABC 记谱),再渲染成带人声与伴奏的完整歌曲。同一检查点支持三件事:从零创作、零样本翻唱(转录源曲再换风格)、对话式 Agent 编辑。HKUST / M·A·P / Stanford 等 8 家机构的学术联合作品,权重开放下载,WildSongBench 上与 Suno v5/v6 同台竞争。

项目速览

核心数据

7.3k
Stars
8
联合机构
6.96
SongBench 均分
48kHz
立体声输出
为什么存在

商业音乐 AI 全是黑箱,音乐人没法干活

一次成型,不可干预

Suno/Udio 从歌词直接出音频:旋律和弦埋在波形里,「把副歌改成大调」这种基本操作做不到,只能重抽卡。

闭源 + 订阅墙

最好的音乐模型不可下载、不可微调、商用条款随时变——对音乐工业是平台依赖。

创作需要中间表示

人类作曲的工作对象是谱:可读、可改、可交接。AI 生成若不暴露乐谱层,就进不了真实工作流。

YuE2 的答案:把乐谱作为一等公民——旋律与和弦显式生成、显式可编辑,渲染只是最后一步。

核心理念

Symbolic Planning:乐谱是白盒接口

这是与 Suno 路线之争的本质:黑箱端到端换便捷,白盒符号规划换控制权。YuE2 证明白盒路线也能到前沿质量。

🔥 核心架构

生成管线:AR–NAR 混合 Transformer + 流匹配

歌词 + 风格描述 lyrics + style prompt 或外部提供的 ABC 谱 AR–NAR Mixture-of-Transformers AR 自回归:乐谱(ABC)+ 语义音乐 token 逐 token 生成 NAR 并行:声学 latent 一次性对齐 一个 backbone,符号与音频统一建模 流匹配 semantic tokens → acoustic latents VAE 解码 latents → 48kHz 立体声 创作cot="full" 翻唱cot="melody" 编辑abc=编辑谱 差异只在「乐谱从哪来」:模型写谱 / SheetSage2 转录 / 人类或 Agent 改谱 —— 渲染管线完全同一条 staged API:plan() → generate_semantic() → synthesize() → decode(),任何中间产物(谱/token/latent)都可导出复用
核心生成链路 输入与模式入口 解码为音频
核心能力

创作 · 翻唱 · Agent 编辑

从零创作
  • 歌词 + 风格 → 旋律与和弦计划 → 完整歌曲
  • cot="full" 默认模式
  • 乐谱可读可改,渲染前先「审曲」
零样本翻唱
  • 源录音 → SheetSage2 转谱 → 换风格重唱
  • cot="melody" 保留旋律、伴奏自由
  • 948 首 CLEWS mAP 0.647(无谱仅 0.006)
Agent 对话式编辑
  • 「和声改成爵士、加段萨克斯」→ 改谱 → 重渲染
  • 官方 demo:一首歌 9 步对话 14 个版本
  • 同一生成检查点,无需编辑专用微调

关键洞察:「可编辑」不需要第二个模型——编辑只是把改过的谱重新喂给同一条管线。这把音乐生成从「抽卡」变成了「迭代」。

硬数据

WildSongBench:开源第一,整体登顶

192 条评测 prompt · 自动评测 · 2026-09-12。SongBench Avg 综合分(越高越好);† = 开放权重,灰条 = 闭源商业系统。

YuE2(best-of-8) †
6.96
Mureka 9
6.94
Suno v5
6.87
YuE2(标准,2 选 1) †
6.73
Suno v5.5
6.72
Suno v6
6.56
LeVo 2 †
6.32
MiniMax Music 2.6
6.32
ACE-Step 1.5 †
6.01
YuE 1(上代)†
4.92

原文注记:榜首间差距未达统计显著;各单项指标冠军不一(Suno v6 Wild 的 MuLan 最高、v4.5 的 PER 最低)。指标含 AudioBox 制作质量 + MuLan 文本对齐 + 发音错误率。

生态

不止生成器:全家桶各带 SOTA

成员角色成绩
YuE2-3B歌曲生成主模型(符号规划/翻唱/编辑一体)WildSongBench 开源最高
MERT2音乐理解表征(30s 与全曲两版)MARBLE 15 项指标中 14 项 SOTA;GTZAN 流派 91.72%
SheetSage2音频转乐谱转录(翻唱/编辑的入口)13 项基准中 10 项 SOTA;RWC-POP 人声旋律 F1 82.51%
WildSongBench评测集(192 prompt + 复现协议)开源音乐生成的公开竞技场
YuE2-Vae / legacy两个解码器:默认听感 vs 基准协议—

研究闭环完整:理解(MERT2)→ 转录(SheetSage2)→ 生成(YuE2)→ 评测(WSB)全部开放——别人做产品,这个团队顺手把学科基建也铺了。

上手

快速开始:一条管线四个阶段

# Linux · Python 3.12 · 24GB VRAM(BF16)
git clone https://github.com/multimodal-art-projection/YuE.git
cd YuE && python3.12 -m venv .venv && source .venv/bin/activate
python -m pip install .
python examples/generate.py --output outputs/first-song

# Python staged API:中间产物皆可导出
from yue2 import YuE2Pipeline
with YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B",
        device="cuda") as pipe:
    plan = pipe.plan(**request)      # 乐谱 ABC
    song = pipe(**request)           # 全流程
    song.save_artifacts("outputs/my-song")
  • 输出不只是音频:目录同时保留乐谱、语义 token、声学 latent、生成设置——可复现、可改谱重渲染
  • 四种 cot 模式:full(默认创作)/ melody(翻唱推荐)/ off(直接生成)/ abc=...(自带谱)
  • 权重首次运行自动下载(Hugging Face);量化关闭,原生 48kHz 立体声
  • 转谱翻唱:SheetSage2 在独立环境运行,详见 docs/covers.md
生态

官方 Agent Skill:让 AI 编曲师上岗

对比

白盒开源 vs 黑箱商业

YuE2 的牌
  • 权重可下载、可微调(个人/研究)
  • 乐谱层可读可改,进真实音乐工作流
  • 翻唱/编辑同一检查点,无需订阅多产品
  • 评测协议公开,成绩可复现
Suno 的牌
  • 零门槛:手机上 30 秒出歌
  • 无需 24GB 显卡,无需 Linux
  • 闭源持续迭代,商用授权打包
  • 单项指标仍有领先(文本对齐、发音)

定位差异:Suno 卖「出歌的便利」,YuE2 给「做歌的控制权」。要改谱、要翻唱、要离线、要研究——只有后者可选。

风险提示

需要警惕

潜力评估

评分:8.5 / 10 · tracking

模型质量
9.0
技术路线
9.0
生态完整度
8.5
上手门槛
5.5
商用友好
4.0

符号规划路线第一次把开源音乐生成推到前沿质量,且理解/转录/生成/评测全链路开放。若 Agent 编辑工作流成熟 + 商用授权路径明确,可能改变音乐 AI 的生产范式。学术团队的产品化执行力是最大不确定项。


1 / 14