Music-JEPA 用动作学习钢琴声音世界模型
iScienceLuvr · x · 2026-07-27
- Music-JEPA 的核心想法是把钢琴音乐看成一个动作条件系统:把音频当作“状态”,把 pianoroll 当作“动作”,用 JEPA 风格目标去学习潜在世界模型。
- 论文声称,这种表示不仅能刻画音乐动作与声音结果之间的关系,还能支持 beat tracking、作曲家识别、调性估计 等下游任务。
- 更有意思的是,它还能通过“规划”来做 钢琴转录:搜索一组最能解释目标声音的动作。
- 配图里能看到论文标题、作者信息(包括 Yann LeCun)以及模型框架图,整体是一篇偏方法论的音频/多模态研究。
「多模态」频道最新
- 用户给 Opus 5.5 三小时预算,模型自主拍出九龙超现实恐怖短片 — rainbird · 2026-09-23
- AI 生图博主分享高速公路场景 prompt,自晒连续出图效果 — techhalla · 2026-09-23
- Opus 5.5 生成 2000 年代风格火柴人格斗动画 — JasonBotterill · 2026-09-23
- 《平常》:AI 生成九龙城寨题材恐怖短片引发关注 — rainbird · 2026-09-23
- 截图角色配一条提示词即可生成同款角色 — iamaliveix · 2026-09-23
- Google 开源 Noto 3D:2D 贴纸变立体,才发现狗狗只有三条腿 — GoogleDesign · 2026-09-23