WanSong v1.0 Technical Report
Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
eess.AS, cs.CV
2026-07-16
阿里 Wan 团队用约 25B 参数的纯扩散模型端到端生成最长 5 分钟的多语种歌曲,直接输出人声与伴奏双分轨,歌词发音错误率 7.43%,优于 SunoV5.5 的 9.86%。
Suno、Mureka 这类商用歌曲生成模型基本都建立在自回归(AR)建模上:逐 token 串行生成,长歌要么推理慢,要么听感一致性撑不住;后来一些方案在 AR 之后串一级扩散模型做润色,管线变成多段拼接。阿里 Wan 团队问的问题是:能不能扔掉 AR 主干,用一个纯扩散模型端到端生成 5 分钟级别的完整歌曲,同时把人声和伴奏分开输出。
音频表示上,1D VAE 把 44.1kHz 立体声压成连续 latent,压缩率 1024,latent 帧率约 43.1Hz。消融显示这个压缩率是音质与效率的主导因素:从 2048 降到 1024,SI-SDR 提高 2.86dB;保持有效压缩率 2048、只把 patch size 从 1 提到 2,发音错误率反而从 19.2% 升到 20.6%,说明大 patch 带来的劣化靠 VAE 配置补不回来。
双流 token 是核心设计。人声和伴奏各自独立成流输出,但在每个 transformer block 内部当作同一 token 的不同通道一起学习。动机是 CFG 拉不平两者:CFG 调大人声准但伴奏被压,调小伴奏好但人声糊。分开建模后两条流各调各的,顺带直接输出分轨,后期编辑省掉一步源分离。
骨干是 hybrid-MMDit:文本 token 与音频 token 拼成一条序列进同一个 transformer,全共享 AdaLN(沿自 Wan2.1),约 25B 参数。训练用 flow matching,三阶段预训练(90s、300s、SFT),数据超 600 万小时多语种歌曲。
RLHF 分三个维度(乐感、歌词准确、prompt 对齐)各训一个 reward model,先 DPO 后 ReFL:DPO 对所有时间步都有监督、利于全局结构,但成对损失噪声大;ReFL 只在低噪声段有效、管细粒度细节,也更容易被 reward hack。两者按顺序串起来互补。
测试集 200 首,覆盖中英日韩四语、10+ 曲风,每首约 4 分钟:
| 模型 | 乐感(自训裁判) | 歌词发音错误率 PER↓ | SongBench Musicality |
| WanSong | 5.49 | 7.43% | 6.17 |
| SunoV5.5 | 4.31 | 9.86% | 5.99 |
| SunoV5 | 4.18 | 22.80% | 6.17 |
| MurekaV7.6 | 3.83 | 12.7% | 6.07 |
| LeVo | 1.69 | 27.11% | 3.96 |
PER 领先第二名 SunoV5.5 约 2.4 个百分点。公共裁判上的差距很小(SongBench Musicality 与 SunoV5 打平),论文自己也指出 EvalScore、SongBench 这类裁判训练数据只有几千到一万首、泛化存疑,才补了在 8 万首人工标注上训练的自家乐感模型。
纯扩散路线在图像生成早已是主流,这篇把它在歌曲这种分钟级、双流结构的模态上跑到了商用指标,给「长音频必须 AR」的默认假设提供了一个反例。直接输出人声/伴奏分轨,对后期混音、翻唱、定制微调都是实打实的工程便利;扩散框架还允许用 step-distillation 压推理步数,这是论文主张的相对 AR 的效率来源。
step-distillation 只在摘要和结论里出现,全文没有给出任何蒸馏步数或加速倍数,效率优势停留在口头。
最亮眼的「乐感 5.49 vs 4.31」出自自训裁判,训练数据与被评模型同源,自家裁判评自家模型,偏差风险明摆着;且与 SunoV5.5 的差距只在这一个裁判上成立。
对照系 Suno、Mureka 是商用黑盒,采样参数与版本细节不可控,横向比较的公平性没法核验。
压缩率没有继续下探,作者承认是算力与生成速度约束,音质上限可能还没摸到。