改音色别把拍子改丢,MuseCPEval用10个指标拆音乐编辑保持

Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing Systems

Yash Vishe, Eric Xue, Xunyi Jiang, Zachary Novack, Junda Wu, Julian McAuley, Xin Xu

cs.SD, cs.AI

2025-12-17

音乐编辑该改什么就改什么,其余应原样留下。MuseCPEval用四类10个指标检验,听感一致率在节奏上100%,旋律只有45.5%。

这篇在解决什么

文本引导的音乐编辑已经能做音色迁移、换乐器、改风格。评测却几乎只报「编完好不好听」,很少系统问:不该动的那些音乐属性,还在不在。论文把这件事叫 Music Context Preservation,简称 MuseCP。

现有工作即使提到保持,也只抽一两面。ZETA 看结构,Audio Prompt Adapter 看和声,SteerMusic 看旋律。AUDIT、Instruct-MusicGen 这类系统在论文统计里根本没做 MuseCP 评测。没有统一工具,就无法判断一次「成功的风格迁移」是改对了音色,还是顺手把拍号和曲式也改了。

方法

给定原曲 x 和编辑结果 x',MuseCPEval 在四个面向各设细指标,共 10 个。

和声:五度圈距离 CoF,把大小调归一后看调号隔了几步,0 同调、1 最远;全局 chroma 余弦;chroma 序列的 DTW 相似,用来抓随时间走的和弦变化。

节奏与节拍:折叠 BPM 差,把倍速、半速这种倍频误差折掉;Beat F-measure,正负 70 ms 窗口对拍;Information Gain,看相位误差是集中还是均匀散开。

结构:用 msaf 切段后算成对 F 值和 Adjusted Rand Index,既奖「该在一起的在一起」,也奖「该分开的分开」。

旋律与动机:轮廓 DTW;音程 3-gram 召回,原曲里短动机有多少在编辑后还在。

附录应审稿人要求加了音色:MFCC 高斯的对称 KL 相似,以及平均 MFCC 余弦。主文四类仍是和声、节奏、结构、旋律。

验证两路。客观侧从 Lakh 选 50 条旋律、节拍、曲式都清楚的 MIDI,做 8 种只打一个面向的编辑再渲染成音频,看指标是否按预期动。听感侧每个面向 4 道成对比较,同一操作两种强度,11 名过 sanity check 的听者标哪个离原曲更远。问卷共收回 33 份,过关 11 份。

案例研究覆盖四个系统,设置跟各自原论文走,所以分数不能横比:MusicMagus 60 对风格或乐器迁移;ZETA 在 MedleyDB 上 324 条文本编辑;Audio Prompt Adapter 40 条乘 3 条乐器指令;Instruct-MusicGen 在 Slakh 上每类 150 对,做加、减、抽轨道。

结果

受控编辑上,指标大体按设计动。升纯五度,CoF 均值 0.18,理论约 0.167;节奏指标几乎不动。速度加 50%,折叠 BPM 差 26.10,BeatF 掉到 0.24,IG 0.19。整段拍点后移 150 ms,BeatF 崩到 0.03,因为超出 70 ms 窗口,IG 仍有 0.63,固定相位偏移不会把误差摊成均匀分布。结构指标在未改曲式的操作上到不了 1.0,分段器对频谱变化过敏,但结构编辑和结构保持之间仍分得开。

听感对齐不均匀。节奏面向,指标、金标、听者三者一致率 100%。和声上指标对金标 93.2%,对听者 65.9%。旋律对听者只有 45.5%,这篇最不稳的面向是旋律。

四个编辑系统只能当诊断画像,不能排名。Audio Prompt Adapter 的 ChromaSim 0.95、StructPairF 0.88,高层和声和曲式留得住,ΔBPM 却到 20.856。Instruct-MusicGen 的 ΔBPM 20.012,节奏和旋律都差,和它只训轻量融合、不管拍点对齐一致;加轨减轨本身也可能带走主旋律。MusicMagus 的 ΔBPM 5.573,ZETA 4.253,全局速度更稳,但 MusicMagus 的 BeatF 和 IG 接近 0,论文倾向解释成风格迁移带来的节奏变形,不一定是事故。ZETA 靠 DDPM inversion 钉住源信号轨迹,和声和拍点保持最像它的机制该有的样子。

为什么重要

做音乐编辑的人终于有一套「不该动的动了没有」的拆分表,比单一听感分更适合当回归测试。Chroma 很高、BeatF 接近 0,说明模型留住了调性、丢掉了拍点,该补时间对齐,不必再堆一个审美分。代码和 demo 已公开。

这是评测框架,不提供新的编辑模型。四个案例协议不同,不能当系统榜。

局限与存疑

客观验证在 MIDI 上做符号域精确编辑再渲染,真实扩散编辑是缠在一起的频谱变化,指标在野外的解耦程度没有同等证据。结构指标连移调都会被分段器拖低,相对排序可用,绝对值不能当「结构完美」。听感有效样本 11,旋律一致率 45.5%,这个面向目前更像参考项。主实验没把四个系统放到同一数据、同一指令集上,诊断结论依赖各自官方设定。音色指标在附录,主框架仍是四类;若编辑任务就是换乐器,音色保持不该当惩罚,论文需要使用方自己关掉对应项,目前没有官方的「目标面向掩码」协议。

术语

原文与代码

相关论文

全部论文解读