LeVJEPA 视频编码器:预训练算力降 5.6-20.8 倍仍追平 V-JEPA 2
CSProfKGD · x · 2026-09-03
Lukas Kuhn 将于 9 月 8 日在 Cohere Labs Open Science Community 公开演讲,介绍新视频自监督预训练方法 LeVJEPA——首个在 LeJEPA 无坍缩目标下训练的视频编码器。
方法要点:
- 现有视频自监督方法要么靠架构不对称(EMA 目标编码器、stop-gradient、容量受限预测器)防表征坍缩,要么在像素空间重建被遮蔽内容,计算都很昂贵
- LeVJEPA 抛弃两者:单一编码器配合投影器,对 clip 的全局和局部视图做不变性损失,用 SIGReg 以可证明的方式排除坍缩,目标函数只剩一个超参数
- 均匀随机 token 丢弃减少预训练看到的 token 数,同时提升下游精度
结果:
- 在相同数据、相同 epoch 下,LeVJEPA 用 5.620.8 倍更少的预训练算力,在 ViT-S/B/L 上匹配或超越 V-JEPA 2
- 在相同总 FLOPs 下,在 ImageNet-1K 上超最强视频基线 7.6 分,同时在以运动为核心的基准上保持竞争力
- 由于不需要分支间不对称,架构与训练流程都大幅简化
活动免费开放,可在线注册参加。
「研究」频道最新
- KAIST 提出 Declarative Attention,让模型自选跳读 KV 缓存 — kaist-ai · 2026-09-03
- NVIDIA 后训练模型在 IOI 编程竞赛超越顶级人类选手 — nvidia · 2026-09-03
- Kirin 从野外视频重建 3D 动物运动,构建大规模数据集 — Brian Nlong Zhao · 2026-09-03
- BPCO 论文给出更稳定的 LLM PPO 训练配方,细节全公开 — max_paperclips · 2026-09-03
- Puffin-World 开源:原生带几何与物理的 3D 世界模型 — ccloy · 2026-09-03
- 手工推导 Hessian 对角估计器:可作为 LLM 训练新数据? — Aiden_Tech_Ai · 2026-09-03