无需重构损失:分层自监督世界模型提升音乐 Agent 理解力

drscotthawley · x · 2026-08-06

Scott H. Hawley 发布了论文《Helping Music Co-Creation Agents 'Listen' Well》,提出了一种基于 Swin-Transformer 的掩码自编码器(表示自编码器)。该模型在 MIDI 钢琴卷帘图像上进行训练,完全依赖内部一致性目标(如 LeJEPA 吸引和跨层掩码预测),不使用任何重构损失。

实验表明,该模型学习到的六级层次结构能有效编码音乐特征:

作者同步发布了 STORMBIRD 测试套件,对九种编码器变体进行了全面探测。代码和权重计划在 NeurIPS 前后开源。

所属事件:MIDI-RAE-JEPA提升音乐Agent理解力(3 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →