助力音乐 Agent「听」懂音乐:分层自监督世界模型

drscotthawley · x · 2026-08-06

作者分享了其关于音乐协同创作智能体的最新预印本论文《Helping Music Co-Creation Agents 'Listen' Well》。研究提出了一个用于符号音乐的分层自监督「世界模型」。

该模型核心是一个 2.55M 参数的 Swin V2 编码器,使用 JEPA 风格的目标(音高和时间偏移等变性、掩码嵌入预测和分布正则化)进行训练,无需任何标签或乐理词汇。探针实验表明,音乐属性可解码的层级与其音乐时间尺度相关:乐句边界在最粗糙层级读取,音符密度与和声细节在最精细层级读取。

此外,通过引入小型和弦监督头,联合和弦恢复率从 0.18 提升至 0.54,从未被监督的调性检测准确率从 0.16 跃升至 0.70。模型还结合了条件流匹配技术,在像素空间实现了 0.996 的目标窗口重建 F1 分数。

所属事件:MIDI-RAE-JEPA提升音乐Agent理解力(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →