LeCun 团队 LeVJEPA:视频预训练算力直降 5.6–20.8 倍
TheTuringPost · x · 2026-08-30
Yann LeCun、Randall Balestriero 等人发布新论文 LeVJEPA,把 LeJEPA 的免坍缩目标扩展到视频,目标是让视频预训练更便宜、更简单。论文、代码与项目页均已公开。
方法要点
- 架构极简:单个编码器 + 一个小 projector(训练后即丢弃),不需要 V-JEPA 那类 EMA target encoder、stop-gradient 或容量受限 predictor 等非对称设计,仅一个超参数。
- 对同一段 16 帧视频剪辑构造一个全视角与多个裁剪/增广视角,用不变性损失拉近同视频不同视角的表征,并用 SIGReg 正则化防止表征坍缩(有可证明保证)。
效率设计
- 训练时只处理约 5% 的 video token,其余随机丢弃以省算力,且同时提升下游精度。
- 注意力在时间维度是因果的:每帧只看当前与之前的帧,适合流式视频与需要持续更新「理解」的世界模型。
结果:相同数据与 epoch 下,LeVJEPA 在 ViT-S/B/L 上以 5.6–20.8 倍更少的预训练算力匹敌或超过 V-JEPA 2;算力对齐时在 ImageNet-1K 上比最强视频基线高 7.6 点,同时在运动类基准上保持竞争力。
所属事件:LeCun 团队发布 LeVJEPA,视频预训练算力最高降 20 倍(6 条相关)→
「模型」频道最新
- 老炮提醒:模型进步很快,但能力边界依旧参差 — Dan_Jeffries1 · 2026-09-23
- LLM 当概率分类器不够,研究者提醒需校准才能用于决策 — PMinervini · 2026-09-23
- Jev 模型 2 秒做完 40 道数学题仅花 $0.0008,准确率持平 GPT-5.4 — xeophon · 2026-09-23
- vLLM 支持 Google DiffusionGemma:块扩散 MoE 吞吐约提升 1.9 倍 — vllm_project · 2026-09-23
- Opus 5.5 质量更优,GPT-6 每任务便宜 7.8 倍 — haider1 · 2026-09-23
- 降价 40% 加 AGENTS.md,Anthropic 四招挽回开发者社区 — iannuttall · 2026-09-23