Diptych: Scoped, AI-Interpreted Comparison for Reference Listening in Music Production
Chongjun Zhong, Abhinaba Roy, Archishman Ghosh, Kejun Zhang, Dorien Herremans
cs.HC
2026-09-30
DipTych 让音乐人自选对比段落、AI 解读 59 项特征:12 人实测新增 10 项差异、9 项获专家背书,原有判断支持率没动。
混音和母带里有个标准动作叫 reference listening(参考聆听):放一段半成品,再放参考曲的对应位置,来回切换找差距。现有工具(Ozone、Logic Pro 一类)只在整曲级别报频谱和响度差异,而两首歌结构天然不对齐,A 曲的 chorus 在两分钟处,B 曲的可能在三十秒处。想把两段 chorus 对着比,工具做不到,「比什么」这个决定被它替用户做掉了。
论文把参考聆听拆成两层:决定比什么,读懂差异在哪。前者是人的判断;后者帮起来也比想象中难。听觉对比依赖工作记忆,一边在放,另一边的印象就在褪色;音乐人常常听得出问题却说不出来。音频大模型能对两首歌写出流畅正确的差异描述,但准确的陈述救不回一个选错的对比。
设计一句话讲完:用户定范围,AI 在范围内解读。
8 个维度来自三个独立来源的汇合:工程师描述参考曲的惯用维度、MIR 社区的内容分面、制作知识工程的分类法。特征入表的标准是给生产者一个可核查的行动点,比如 vibrato rate、swing ratio、LUFS。
12 位音乐人(经验 1 年到 10 年以上)分 4 组,各完成一组固定目标曲与参考曲的对比:先裸听 A/B 记录判断,再用系统逐条复查(保留、修改、撤回、新增);4 位专家盲听后对匿名论断做来源盲评级。
| 指标 | 结果 |
| 原有判断获双专家完全支持(用前 → 用后) | 24/38(63.2%)→ 23/38(60.5%) |
| 至少部分支持(两个阶段各自) | 32/38(84.2%) |
| 用后新增判断 | 10 项,9 项获至少部分支持、4 项双专家完全支持 |
| SUS 可用性 | 均值 74.79(SD 9.26),行业基准 68 |
| 认为系统有帮助 | 11/12 |
| 对下一步更清楚 | 12/12 |
| 「非常信任」结果 | 8/12 |
| 认为 AI 有时把没把握的说得太笃定 | 4/12 |
最关键的反差是置信度与准确度脱钩:35 条有完整置信度评级的判断里,15 条用后上升,其中 7 条始终没拿到双专家完全支持。用后的判断更长、术语更多,引用 BPM、立体声宽度、瞬态,专家支持率没有跟着动。失败案例也具体:纯器乐里报出人声和音区,专家没听到的 shuffle 感、短暂转调被写进结论。只有 2/12 觉得被推向参考曲。
价值主要在评测的拆法,不在系统。感知有用和判断变准是两回事,论文用专家盲评把两者分开量,量出了分离:SUS 74.79、11/12 称有帮助,原有判断支持率原地踏步。做 AI 反馈类产品的人可以直接搬这套评测,满意度再高也不代表用户判断质量在涨。
一条从数据里长出来的原则:指向比下结论更赢得信任。被最多人认可的是分段标记、时间点、A/B 切换,它们把人带到正确位置就算对;文字结论的对错取决于系统对音乐的理解,信任问题全出在这里。对「去哪听」可以自信,「这意味着什么」留给用户。视频剪辑、写作修改是论文点名的同类场景。系统本身是渐进改进。
作者自述:专家评级留有个人解读空间,只能当评估框架内的支持度,不是对错金标准;59 个特征精度参差、选自文献而非与生产者的形成性研究,哪些真正承重没测过;单次会话设计评估的是接触完整系统后的变化,归因不到 AI 组件头上。
读下来还有几处:12 人、4 对曲目的规模下,63.2% 到 60.5% 的单点波动说明不了方向;新增 10 项里仅 4 项双专家完全支持、1 项被判不支持,「发现更多」里混着弱根据断言,作者也承认;没人真正用它给自己的作品做决定,「对下一步更清楚」是自我报告,没有后续行为数据。