阿里 WanSong:纯扩散一次生成 5 分钟整曲,人声伴奏直接分轨

WanSong v1.0 Technical Report

Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou

eess.AS, cs.CV

2026-07-16

阿里 Wan 团队用约 25B 参数的纯扩散模型端到端生成最长 5 分钟的多语种歌曲,直接输出人声与伴奏双分轨,歌词发音错误率 7.43%,优于 SunoV5.5 的 9.86%。

这篇在解决什么

Suno、Mureka 这类商用歌曲生成模型基本都建立在自回归(AR)建模上:逐 token 串行生成,长歌要么推理慢,要么听感一致性撑不住;后来一些方案在 AR 之后串一级扩散模型做润色,管线变成多段拼接。阿里 Wan 团队问的问题是:能不能扔掉 AR 主干,用一个纯扩散模型端到端生成 5 分钟级别的完整歌曲,同时把人声和伴奏分开输出。

方法

音频表示上,1D VAE 把 44.1kHz 立体声压成连续 latent,压缩率 1024,latent 帧率约 43.1Hz。消融显示这个压缩率是音质与效率的主导因素:从 2048 降到 1024,SI-SDR 提高 2.86dB;保持有效压缩率 2048、只把 patch size 从 1 提到 2,发音错误率反而从 19.2% 升到 20.6%,说明大 patch 带来的劣化靠 VAE 配置补不回来。

双流 token 是核心设计。人声和伴奏各自独立成流输出,但在每个 transformer block 内部当作同一 token 的不同通道一起学习。动机是 CFG 拉不平两者:CFG 调大人声准但伴奏被压,调小伴奏好但人声糊。分开建模后两条流各调各的,顺带直接输出分轨,后期编辑省掉一步源分离。

骨干是 hybrid-MMDit:文本 token 与音频 token 拼成一条序列进同一个 transformer,全共享 AdaLN(沿自 Wan2.1),约 25B 参数。训练用 flow matching,三阶段预训练(90s、300s、SFT),数据超 600 万小时多语种歌曲。

RLHF 分三个维度(乐感、歌词准确、prompt 对齐)各训一个 reward model,先 DPO 后 ReFL:DPO 对所有时间步都有监督、利于全局结构,但成对损失噪声大;ReFL 只在低噪声段有效、管细粒度细节,也更容易被 reward hack。两者按顺序串起来互补。

结果

测试集 200 首,覆盖中英日韩四语、10+ 曲风,每首约 4 分钟:

模型乐感(自训裁判)歌词发音错误率 PER↓SongBench Musicality
WanSong5.497.43%6.17
SunoV5.54.319.86%5.99
SunoV54.1822.80%6.17
MurekaV7.63.8312.7%6.07
LeVo1.6927.11%3.96

PER 领先第二名 SunoV5.5 约 2.4 个百分点。公共裁判上的差距很小(SongBench Musicality 与 SunoV5 打平),论文自己也指出 EvalScore、SongBench 这类裁判训练数据只有几千到一万首、泛化存疑,才补了在 8 万首人工标注上训练的自家乐感模型。

为什么重要

纯扩散路线在图像生成早已是主流,这篇把它在歌曲这种分钟级、双流结构的模态上跑到了商用指标,给「长音频必须 AR」的默认假设提供了一个反例。直接输出人声/伴奏分轨,对后期混音、翻唱、定制微调都是实打实的工程便利;扩散框架还允许用 step-distillation 压推理步数,这是论文主张的相对 AR 的效率来源。

局限与存疑

step-distillation 只在摘要和结论里出现,全文没有给出任何蒸馏步数或加速倍数,效率优势停留在口头。

最亮眼的「乐感 5.49 vs 4.31」出自自训裁判,训练数据与被评模型同源,自家裁判评自家模型,偏差风险明摆着;且与 SunoV5.5 的差距只在这一个裁判上成立。

对照系 Suno、Mureka 是商用黑盒,采样参数与版本细节不可控,横向比较的公平性没法核验。

压缩率没有继续下探,作者承认是算力与生成速度约束,音质上限可能还没摸到。

术语

原文与代码

社区讨论

相关论文

全部论文解读