阶跃音乐用单码本加乐谱规划,AudioBox 三项第一

StepAudio 3 Music Technical Report

Chengli Feng, Zhiyue Wu, Jiahao Song, Zheqi Dai, Boyang Wang, Ruibin Yuan, Junming Gong, Wenxiao Zhao, Jing Guo, Gang Yu, Xiangyu Zhang, Xuerui Yang, Chao Yan

eess.AS, cs.SD

2026-09-11

阶跃推出长歌曲生成模型,用单码本加 ABC 乐谱做编曲规划,0.9B DiT 渲成 48kHz 波形,最长 5 分 30 秒。AudioBox 三项第一,MuQ-MuLan 0.4465;盲测 Elo 1105,次于 Suno V5.5 和 Mureka。

这篇在解决什么

歌曲生成现在不难出一段好听的 30 秒,难的是把旋律发展、段落切换、歌词和编曲在五分钟尺度上对齐,同时还让创作者能改「这一小节的和弦」,而不是只能改一句氛围提示。扩散和 flow-matching 把声学细节做漂亮了,语言模型负责长程结构。中间那层计划往往是黑盒:MusiCoT 用量化 CLAP,Qwen-Music 用旋律 token,ACE-Step 1.5 吐元数据。创作者读不懂,也就改不了。

阶跃 StepAudio 3 Music 把中间计划写成能读的 ABC 记谱(ABC-CoT),再拿 50Hz 单码本 token 做序列,用 flow-matching DiT 渲成 48kHz。训练语料超过 1 亿首歌、500 万小时、约 1 万亿 token,最长生成 5 分 30 秒。

方法

三件套:tokenizer、MoE 自回归模型、DiT 渲染器。codec 单独训完冻住,LLM 只学 token。

离散瓶颈是这篇真正较真的地方。他们把单码本 VQ、Semantic RVQ、Acoustic RVQ 都钉在 25Hz 上比。多码本 RVQ 从真值 token 重建明显更好,但拿预测 token 生成时,Acoustic RVQ 内部听感差,Semantic RVQ 保真度还行但乐感弱,误差会在残差码本之间累积。单码本 VQ 保真度只小幅落后,乐感更稳。选定单码本后再把帧率从 25Hz 提到 50Hz:保真度差不多,乐感更好,同一批数据的监督密度翻倍。最终 tokenizer 是约 0.6B 双向 Conformer,65536 词表,每帧一个 token,名义码率 800 bit/s。

渲染侧更反直觉。DiT 从 0.9B 扩到 4B、8B,在固定 tokenizer、真值 token 的条件下,0.9B 反而在 MCD、Mel/STFT L1、SI-SNR、UTMOS 上最好。信息天花板在离散表示,堆渲染器容量补不回来。长音频按 30 秒一块渲,下一块看上一块最后 2 秒的 VAE latent。

ABC-CoT 是两段式:先根据歌词、文本提示和可选参考写出速度、拍号、调性、和弦、小节和旋律,再在这份谱上预测音乐 token。正反任务都训,music-to-ABC 和 ABC-to-music。

数据管线走带宽过滤、事件检测、Demucs 人声伴奏分离、MMS-LID 语种、中英 FireRed ASR、其他语种 WhisperX、SongFormer 分段。LLM 从文本 MoE 初始化,预训练三阶段大约 600B + 500B + 80B token,中训里 ABC-CoT 约占 16%。SFT 约 20B,覆盖歌词生歌、纯器乐、干声伴奏、翻唱。DPO 用约 500 条提示,每条 4 组条件各抽 4 个候选,专家听完取偏好差距最大的一对,大约 2000 对。

结果

主客观对比在歌词生歌 339 条公共子集(AudioBox / MuQ-MuLan)和 316 条带人声的 SongBench 子集上,对手是 Suno V5.5、Suno V5、Mureka V9、MiniMax Music 3。

指标StepAudio 3 Music最强对照
MuQ-MuLan0.4465Suno V5.5 0.4437
AudioBox CE7.7086Suno V5 7.6823
AudioBox CU8.0052Suno V5.5 7.9584
AudioBox PQ8.3868Suno V5.5 8.2988
SongBench Musicality5.7465Mureka V9 5.9382

AudioBox 三项和 caption 对齐拿下最高,SongBench 各维是 Mureka V9 领先。Artificial Analysis Music Arena Vocals 盲测 Quality Elo 1105,排在给出的榜单第四,只落后 Suno V5.5 和 Mureka,高于 Suno V5 和 MiniMax。Arena 让模型自己写词,和内部固定歌词评测不是同一件事。

DPO 相对 SFT:Musicality 5.6395→5.7465,SongBench 七维均分 6.5445→6.6438,MuQ-MuLan 0.4157→0.4465。推理时加 ABC-CoT,均分从 6.6438 到 6.6713,再让文本 LLM 改一版谱,到 6.7220;混音、编曲、旋律提升最大,人声几乎不动。模型自己写的谱帮助有限,外部改谱更有用。

为什么重要

生成导向的 codec 选择和重建导向是两回事。谁家 RVQ 层数更多、重建指标更高,不代表语言模型更能把歌唱完。0.9B DiT 打过 8B 也在说同一件事:瓶颈在 token,不在渲染器。ABC 乐谱作为可编辑中间层,比黑盒 CoT 更接近编曲工作流。分数提升很小,编辑谱比模型自己写谱更值钱。

这是能打到 Suno / Mureka 附近的闭源系统报告。最长 5 分 30 秒、干声伴奏和翻唱写进了任务表,主表只证明了歌词生歌这一路。

局限与存疑

作者写得很清楚:评测子集主要是人声和歌词条件,器乐、翻唱、干声伴奏没有对照表;MuQ-MuLan 和听感不等于按小节遵守 ABC;SFT 用 SongBench Musicality 筛过数据,这项分数和选数不独立;每条条件只生成一次,没有种子方差;基线来自托管产品接口,服务端配置不可复现;ABC-CoT 加 LLM 编辑是整条推理工作流,拆不开每一步的贡献。

Elo 1105 是「初步」榜,论文没有给出完整置信区间表。复杂编曲、超长依赖、人声自然度、高频重建,结论里自己列为待改进。内部专家听感支撑了单码本选择,那一轮没有单独的受控听音实验。

术语

原文与代码

相关论文

全部论文解读