LeVJEPA:无启发式视频预训练,算力省 5.6-20.8 倍还超 V-JEPA 2
Cohere · youtube · 2026-09-12
Kuhn 等提出 LeVJEPA,首个在 LeJEPA 无坍塌目标下训练的视频编码器,去掉了 EMA 目标编码器、stop-gradient、受限预测器等架构不对称,也不用像素空间掩码重建。架构简化为编码器+投影器,目标函数仅一个超参数(SIGReg 正则)。关键结果:
- 在相同数据与 epoch 下,LeVJEPA 在 ViT-S/B/L 上以 5.6 至 20.8 倍更少的预训练算力持平或超越 V-JEPA 2;
- 等总 FLOPs 时,ImageNet-1K 上超出最强视频基线 7.6 个百分点,运动类基准仍有竞争力;
- 无需分支不对称,可用块因果注意力训练而无精度损失,时序顺序成为编码器本身的属性;
- 对比算力匹配的 DINOv2,运动类精度接近翻倍。
结论:去掉计算开销后,视频是通用视觉预训练可行甚至更优的基底。
「多模态」频道最新
- AI 叙事处早期电影阶段:Tolan 故事主管类比「活动照片」 — every · 2026-09-12
- ChatGPT Images 2.5 Flare 人类创造力基准摘银,逼近 Muse Image — yuwen_lu_ · 2026-09-12
- ElevenLabs 发布 Music v2.5,音乐生成再升级 — sigvef · 2026-09-12
- fal H3 Max 多角度控制实测:一句话生成莱特兄弟试飞场景 — DavidmComfort · 2026-09-12
- fal 播客对谈短剧创作者:AI 如何改写中美微短剧产业 — gorkem · 2026-09-12
- 用 MiniMax 视频模型自制一部假电影预告片 — ColdComplaint8 · 2026-09-12