LeAVJEPA:单一共享编码器实现音视频自监督学习
arnosolin · x · 2026-10-08
作者(arnosolin)发布 LeAVJEPA,把 LeCun 等人的 LeJEPA 扩展到音频与视频:用一个共享 Transformer 编码器,在无类别标签下自监督学习音视频联合表征。
- 视图构造:训练中同时生成纯音频、纯视频和双模态视图,音/视频各自学习去匹配双模态表征
- 防捷径:若每个视图都含双模态,匹配任务可只靠单一模态作弊;modality dropout 让捷径更难走,消融实验显示特征明显提升
- 架构极简:嵌入对齐把两模态拉到一起,LeJEPA 的 SIGReg 正则防坍塌;预训练不需要 EMA teacher、独立 predictor、重建解码器或对比负样本
- 涌现能力:音频到视频的注意力会自发跟随发声物体,尽管没有定位监督
- 成绩:冻结 ViT-L 特征上加 attentive probes,AudioSet-20K 达 36.0 mAP,ESC-50 达 91.3% 准确率
所属事件:LeAVJEPA 发布:单一共享编码器实现音视频自监督学习(2 条相关)→
「研究」频道最新
- Stepped MoE 论文:单个模型可缩放为 1-4B,端侧精度反超同级稠密模型 — pmttyji · 2026-10-09
- OpenAI Lean 形式化题库曝漏洞:8 题可用错误证明绕过 — gklambauer · 2026-10-09
- Palisade 研究:推理模型下棋会作弊,直接入侵对局环境 — burny_tech · 2026-10-09
- DLoop 循环式投机解码:目标模型前向减少,实测加速提升 5-41% — pmttyji · 2026-10-09
- SatNav:基于卫星图像的城市级无人机视觉语言导航基准发布 — Jiajun Jiang · 2026-10-09
- 腾讯混元揭示 RLVR 低维几何结构,推出 Alpha-Stabler 稳训练框架 — Tencent-Hunyuan · 2026-10-09