Melody-CoT 先规划旋律再生成,Qwen-Music 33B 专业评分胜过 Suno V5

Qwen-Music Technical Report

Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang, Xize Cheng, Xueyao Zhang, Yang Zhang, Yiheng Chen, Yongqi Wang, Yue Wang, Zhifang Guo, Zihan Liu, Zijian Lin, Dake Guo, Hangrui Hu, Lei Xie, Linhan Ma, Wei Xue, Wenxiang Guo, Xinfa Zhu, Xipin Wei, Yangze Li, Yuanjun Lv, Yuxuan Wang, Yunfei Chu, Zhiyong Wu

cs.SD

2026-07-13

Qwen-Music 用 33B LLM 配 Melody-CoT 先规划旋律、再扩散渲染成带人声整歌,专业评测胜 Suno V5 与 MiniMax。

这篇在解决什么

AI 音乐生成这几年卡在一个尴尬位置:能出声、能跟风格,但整首歌的结构、人声的唱段安排、旋律和编曲的连贯性,离专业制作还有距离。已有的开源和商业方案(Suno、MiniMax)大多把生成压在一个端到端模型里,语义(写什么)和声学(怎么响)耦合在一起,难分别优化。

Qwen-Music 想把这两件事拆开:用一个语言模型负责把文字、歌词、音乐属性变成「音乐语义」,再用一个扩散渲染器把它变成可听的立体声波形。

方法

整套系统三段式。Qwen-Music-Tokenizer(0.6B,24 层 Conformer)把 48kHz 立体声音频压成 25Hz 的单码本语义 token 流,码本 32,768 项,码率约 375 bit/s。Qwen-Music-LLM(33B,从 Qwen3.5-Omni 初始化)负责自回归地生成这些语义 token。最后 Qwen-Music-Render(1.3B 的扩散 Transformer)把语义还原成波形,中间过一个 Spec-VAE 做频谱潜空间、一个 Band-Mode Refiner 修频率相关的幅度和相位。

最值得讲的设计是 Melody-CoT。生成整首歌之前,LLM 先用 6.25Hz 的中间旋律 token 把旋律骨架「想」一遍(旋律用 RMVPE 抽取、编码成相对 MIDI),再展开成完整 token。思路和文本里的 chain-of-thought 一样:先把高层结构定下来,细节生成时就有据可依,结构更连贯、创意也更可控。

训练数据是 500 万小时以上的多语种音乐,按质量分 Q1 到 Q7 七档做课程学习(从低质量档预热、逐步切到 Q1 高质量精修)。后训练对齐走了 SFT 冷启动、离线 DPO、在线 GSPO 三段。

结果

专业听审 A/B 盲测里,Qwen-Music 对 MiniMax Music 2.6 的胜率是 66.7%、对 Suno V5 是 55.4%、对 Suno V5.5 是 50.3%(基本打平)。在 Artificial Analysis 带人声音乐榜上以 JazzCat 名义排第三。

对照系统Qwen-Music 胜率
MiniMax Music 2.666.7%
MiniMax Music 2.5+59.1%
Mureka V858.3%
Suno V555.4%
Suno V5.550.3%

客观指标上,SongBench 七个维度里六个最佳,SongEval 五个维度全最佳,歌词可懂度(PER)6.10 排第二低。翻唱生成(用现有歌换风格换人声)在真实流行歌上旋律 MAE 约 1.44 个半音,优于对照。

8 个曲风里 Qwen-Music 在电子/EDM、爵士蓝调、朋克硬核、R&B、摇滚 5 个排第一;Hip-Hop/Rap 排第二,落后 Suno V5.5。

为什么重要

这是把「先规划再生成」从文本搬到了音乐:Melody-CoT 让旋律骨架成为可控的中间表示,而不是让一个端到端模型黑箱地直接吐波形。对做音乐生成和可控音频的人来说,语义层和声学层解耦这个架构选择意味着可以分别迭代、分别评测,翻唱、风格迁移这类任务也有了一个干净的接入点。

局限与存疑

翻唱的旋律保真还有差距:section 级 MAE 约 1.5 个半音,意味着翻唱版相对原曲会跑调到能被听出来的程度。商业对手仍紧:Suno V5.5 在整体胜率上基本打平,在 Hip-Hop 上还领先。报告里的主观评测来自专业听审,样本量和评测者构成没有完全交代,绝对分数要打折看;客观指标(SongBench、SongEval)本身也是模型打分,不是人类主观金标。另外 500 万小时训练数据的来源和版权状况,报告着墨不多。

术语

原文与代码

相关论文

全部论文解读