MIDI-RAE-JEPA:用于符号音乐的分层表征学习

drscotthawley · x · 2026-08-06

作者分享了其提交至 NeurIPS Creative AI Track 的新预印本论文《MIDI-RAE-JEPA》。该研究提出了一种用于符号音乐(以 piano roll 图像形式编码)的分层表征学习方法。

该方法结合了音高与时间偏移等变性目标、LeJEPA 以及 Swin Transformer V2 编码器,完全通过自监督目标进行训练。实验表明,基于冻结的编码器嵌入训练的解码器实现了 0.995 的重建 F1 分数;此外,基于这些嵌入的流匹配生成模型能够生成在音高音区和节奏密度上与条件片段高度匹配的音乐。

所属事件:MIDI-RAE-JEPA提升音乐Agent理解力(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →