无需重构损失:分层自监督世界模型提升音乐 Agent 理解力
drscotthawley · x · 2026-08-06
Scott H. Hawley 发布了论文《Helping Music Co-Creation Agents 'Listen' Well》,提出了一种基于 Swin-Transformer 的掩码自编码器(表示自编码器)。该模型在 MIDI 钢琴卷帘图像上进行训练,完全依赖内部一致性目标(如 LeJEPA 吸引和跨层掩码预测),不使用任何重构损失。
实验表明,该模型学习到的六级层次结构能有效编码音乐特征:
- 和弦与调性:加入轻量级和弦损失后,根音在留出歌曲上的线性解码准确率从随机水平跃升至 90%。
- 乐句边界:边界信息随层级加深单调增加,在最顶层达到像素基线的 3 倍。
- 等变性:在几何目标作用的层级上,对音高和时间偏移的等变性几乎完美。
作者同步发布了 STORMBIRD 测试套件,对九种编码器变体进行了全面探测。代码和权重计划在 NeurIPS 前后开源。
所属事件:MIDI-RAE-JEPA提升音乐Agent理解力(3 条相关)→
「多模态」频道最新
- ComfyUI 分享 AI 后期制作工作流:自定义 LoRA 与动态图形节点 — petewoodbridge · 2026-08-06
- MiniMax H3音乐视频制作教程与工作流发布 — petewoodbridge · 2026-08-06
- Hugging Face展示Cadena:将3D网格反编译为可编辑CAD — huggingface · 2026-08-06
- 用 Minimax 视频模型生成完整音乐 MV — mementomori2344323 · 2026-08-06
- MiniMax H3 登顶三大视频生成榜单,超越字节与谷歌 — petewoodbridge · 2026-08-06
- 实测 UniPASE:劣质语音通话也能完美修复 — multimodalart · 2026-08-06