MIDI-RAE-JEPA:用于符号音乐的分层表征学习
drscotthawley · x · 2026-08-06
作者分享了其提交至 NeurIPS Creative AI Track 的新预印本论文《MIDI-RAE-JEPA》。该研究提出了一种用于符号音乐(以 piano roll 图像形式编码)的分层表征学习方法。
该方法结合了音高与时间偏移等变性目标、LeJEPA 以及 Swin Transformer V2 编码器,完全通过自监督目标进行训练。实验表明,基于冻结的编码器嵌入训练的解码器实现了 0.995 的重建 F1 分数;此外,基于这些嵌入的流匹配生成模型能够生成在音高音区和节奏密度上与条件片段高度匹配的音乐。
所属事件:MIDI-RAE-JEPA提升音乐Agent理解力(3 条相关)→
「多模态」频道最新
- TwelveLabs 高管访谈:原生视频理解是 AI 的下一个前沿 — bigdata · 2026-08-06
- 实测字节 Seedance 2.5:1-2 次提示即可出片,API 即将上线 — nikola_mr64990 · 2026-08-06
- 用 MiniMax 制作 AI 音乐视频《Fuzzy Wuzzy》 — Peemore · 2026-08-06
- MiniMax H3 实测:视频提示词遵循能力惊艳 — jefharris · 2026-08-06
- MiniMax H3+AE工作流:16G显存跑40G模型制作商业短片 — circlenline · 2026-08-06
- Kimi K3 对比 Grok 4.5:谁能更好补全草图? — CodeByPoonam · 2026-08-06