LeVJEPA:无启发式视频预训练,算力省 5.6-20.8 倍还超 V-JEPA 2

Cohere · youtube · 2026-09-12

Kuhn 等提出 LeVJEPA,首个在 LeJEPA 无坍塌目标下训练的视频编码器,去掉了 EMA 目标编码器、stop-gradient、受限预测器等架构不对称,也不用像素空间掩码重建。架构简化为编码器+投影器,目标函数仅一个超参数(SIGReg 正则)。关键结果:

结论:去掉计算开销后,视频是通用视觉预训练可行甚至更优的基底。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →