LeAVJEPA:极简音视频自监督架构,冻结评测达 AudioSet 36.0 mAP
arnosolin · x · 2026-10-08
Aalto 大学 Arno Solin 团队发布 LeAVJEPA,首个基于 LeJEPA 无坍缩目标的音视频自监督编码器。
- 架构极简:单个 early-fusion ViT 同时处理音频、视频及联合输入,无需 EMA 目标编码器、预测头、重建解码器或对比损失。
- 关键机制:modality dropout 把缺失模态视为同一事件的另一视图,使跨模态对齐隐式发生在目标函数中;SIGReg 防止表征坍缩。消融实验确认 modality dropout 是音视频对齐的核心。
- 涌现定位:audio-to-video 注意力自发聚焦于发声物体,模型并未接受任何定位监督。
- 成绩:冻结 ViT-L 特征加 attentive probes,AudioSet-20K 达 36.0 mAP,ESC-50 准确率 91.3%;微调后 VGGSound 61.1%,嵌入还支持零样本音视频检索。
论文、项目页(含交互示例)与代码已开源。
所属事件:LeAVJEPA 发布:单一共享编码器实现音视频自监督学习(2 条相关)→
「研究」频道最新
- 博客长文把激活函数拆成骨架:斜率曲率饱和度如何决定梯度与可训练性 — CatAstro_Piyush · 2026-10-09
- 编码 Agent 别只用扁平上下文窗口:分类型上下文面架构 — Puzzleheaded_Box2842 · 2026-10-09
- SDF 碰撞检测新方法:缓存+重要性采样,数千刚体实时仿真 — Michael_Moroz_ · 2026-10-09
- 新论文提出 Sensitivity AOV:让可微渲染的导数像图像一样可视化和合成 — ssh4net · 2026-10-09
- AI 药物进入临床后期:三款 AI 设计药物推进 II/III 期试验 — FinanceYF5 · 2026-10-09
- 数学证明 Transformer 计算通用,但标准优化器找不到最优点 — Promptmethus · 2026-10-09