LeVJEPA去掉EMA教师,视频预训练最多省20.8倍算力

LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics

Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec, Yann LeCun, Randall Balestriero, Florian Buettner

cs.CV, cs.AI

2026-08-28

把LeJEPA的SIGReg接到视频上,无需教师网络:单编码器、单损失、超参λ固定0.02。同等epoch对标V-JEPA 2且算力只需1/5.6到1/20.8,FLOP对齐时ImageNet高出7.6点。

这篇在解决什么

视频比图信息多,训练也更贵。主流自监督两条路:一条像 V-JEPA / V-JEPA 2,用 EMA 目标编码器、stop-gradient 和容量受限的 predictor 防止表征塌缩;另一条像 VideoMAE,在像素空间重建被遮住的块。两条都把算力花在「为了稳住训练才存在」的部件上:teacher 要对整段 clip 再跑一遍,predictor 要对掩码 query 再跑一遍。

LeJEPA 在静态图像上已经给出另一条:用 SIGReg 把 embedding 推到各向同性高斯,从分布上排除塌缩,架构收成单网络。这篇是第一次把这套目标接到视频编码器上,问两件事。砍掉那些启发式之后,视频预训练能不能既便宜又够用;既然不再需要双塔不对称,能不能直接把时间因果写进编码器。

方法

每个 clip 取 16 帧,做一个全局视图、V 个局部视图(默认 V=4),时间窗相同,局部视图再做空间裁剪和光度增强。同一套编码器 Eθ 处理所有视图,只拿 [cls] 经一个小 projector 映到 K 维再算损失。Projector 是因为最后一层 LayerNorm 把 [cls] 摁在球面上,SIGReg 在球面空间里不好优化;预训练结束后 projector 丢掉,下游用编码器表征。

损失两项。局部 [cls] 去贴全局 [cls] 的 MSE,两边都回传梯度,没有 stop-gradient;再加上 SIGReg。SIGReg 把 batch embedding 投到随机方向,用 Epps–Pulley 正态性检验惩罚偏离标准高斯的投影,从理论上把「某个方向方差为零」的塌缩解排除掉。唯一超参 λ 全程钉在论文给出的默认值 0.02,没有为任何实验再调。

预训练时每个视图随机丢掉 95% 的 patch token。一步的代价由编码器真正看见的 token 数决定,所以丢掉既省 FLOP,也是一种增强:clip 级 embedding 必须能从稀疏、位置随机的观察里推出来。注意力默认 block-causal:帧内双向、帧间因果,[cls] 能看所有 token 但不被看。位置编码用分解的 3D RoPE,同一套权重吃全局和局部两种分辨率。

默认数据是 K710(Kinetics-400/600/700 去掉验证重叠后的并集)的 20% 类别均衡子集。评测冻结编码器:IN1K 和 SSv2 用 attentive probe,K400 用 mean-pool 线性探针,因为 K400 训练集更大,上 attentive probe 成本不成比例。

结果

对照实验把基线都在同一份 20% K710、240 epoch、有效 batch 3072 上重训。

同等 epoch:ViT-S/B/L 上 LeVJEPA 对标或超过 V-JEPA 2,总预训练算力只有对方的 1/5.6 到 1/20.8。ViT-B 两者相差不到 1 个点,算力 4.8 对 36.4 ExaFLOP。ViT-L 上高出 1.9 点,还只要 5.6 倍更少的算力,而且这颗 ViT-L 的总计算量不到 V-JEPA 2 的 ViT-S 的一半。

同等总 FLOP 时,LeVJEPA 因此可以训到 1085 epoch、V=10:

方法IN1KSSv2K400
VideoMAEv253.443.637.4
V-JEPA 251.642.540.7
LeVJEPA61.040.444.6

ImageNet 比最强视频基线高 7.6 点,K400 最高;SSv2 落后 VideoMAEv2 3.2 点。和在相同视频抽帧、相同 FLOP 训的 DINOv2 比:IN1K 50.7 对 53.8(差 3.1),SSv2 30.4 对 16.9,运动侧接近翻倍。

丢掉 token 在 ImageNet 上是单调变好:全保留 33.9%,ρ=0.95 时 47.6%。管状 mask(每帧留同一批空间位置)会把 IN1K 从 50.7% 打到 39.6%。帧级 tokenization(τ=1)优于输入端两帧聚合(τ=2):IN1K 50.7 对 47.4,SSv2 30.4 对 28.8。block-causal 对 bidirectional 是 51.2% 对 50.7%,因果几乎不付钱。

把数据放到 K710 + SSv2 + Walking Tours + PE Video,ViT-L/16 训 100 epoch,冻结探针 IN1K 69.5%、SSv2 55.0%,比 20% K710 上的同尺寸模型 ImageNet 高 9.5 点。消费级验证:ViT-Tiny 在一块 RTX 5080(16 GB)上对 Walking Tours 的 8 段未标注走路视频训 12 小时,IN1K 从初始化 8.9% 到 25.2%;同样 16 GB 卡上 batch 128 显存不到 8 GB,同等大小的 V-JEPA 配置 batch 28 就顶满。

只监督 [cls],patch token 的 PCA 仍能按语义区域分开物体和背景。公开的 V-JEPA 2 没有这个结构,V-JEPA 2.1 是靠额外的 patch 级损失才有。

为什么重要

视频预训练的贵,有一块来自防塌缩的双塔和 predictor,不是视频本身。砍掉之后,95% 随机丢 token 从「逼近」变成「增强」,mask 结构、时间聚合、注意力是否因果都变成可以按下游需求选的旋钮。对要做流式感知或自回归 world model 的人,block-causal 还附带一个推理性质:新帧进来不用重编码过去。

和图像预训练的对比更接近一个立场,而不是一项刷分:同等算力、同一视频源抽帧,外观只落后 DINOv2 约 3 点,运动接近翻倍。视频不再只是「为了动作理解才值得付的附加成本」。改进幅度很大,原理是把已有的 LeJEPA 目标搬到视频,并证明搬走启发式之后效率红利足够大。

局限与存疑

运动理解仍是短板。高丢弃比在短 schedule 上伤 SSv2,加长训练能在同样总计算里补回来,但保时空对应的稀疏采样还没做。对照实验停在 20% K710、最大 ViT-L,SIGReg 在很大 batch 和很大模型上的行为未知;和 V-JEPA 2 那种互联网规模语料的对照也还没有。分割、跟踪等稠密任务没评,只监督 [cls] 长出来的 patch 结构够不够用,目前没有答案。

FLOP 对齐实验里 LeVJEPA 拿到了更长的 schedule 和更多局部视图,效率优势有一部分是「同样预算能多迭代」换来的。这是方法的合法收益,读表时不要当成同一步数下的暴击。K400 用的是更弱的线性探针,数字偏保守,跨方法仍可比,和 IN1K/SSv2 的 attentive probe 不能直接混着喊高低。消费级 25.2% ImageNet 只说明能训起来,离可用表征还早。

术语

原文与代码

社区讨论

相关论文

全部论文解读