LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
Randall Balestriero, Yann LeCun
cs.LG, cs.AI, cs.CV, stat.ML
2025-11-12
Balestriero与LeCun证明各向同性高斯能压低下游最坏风险,用SIGReg把JEPA嵌入推到该分布。去掉教师网络之后,ImageNet-1k上ViT-H/14冻结探针达到79%。
JEPA 把语义相关的两个视图送进同一个编码器,再要求两边的嵌入能互相预测。这条路比对比学习和像素重建更干净,但预测任务有一条现成的捷径:把所有输入压成同一个向量,或者压进一个低维子空间。现成配方用 stop-gradient、教师-学生网络、EMA 日程、显式白化来堵这条捷径,超参一换、骨干一换就塌。
Balestriero 和 LeCun 问的是更靠前的问题:下游任务未知时,嵌入该服从什么分布,才能把探针的最坏风险压到最低。答案写进目标函数,启发式就可以卸掉。
线性探针在固定总方差下,各向同性协方差同时压低偏差和方差;半径 k-NN 和核回归在同类约束下,最优分布收成标准各向同性高斯。这就是 Latent-Euclidean 的来源:嵌入空间按欧氏几何用,分布就该是圆球高斯,不能是扁椭球。
SIGReg 负责把高维嵌入推到这个分布。Cramér-Wold 定理说,所有一维投影都是高斯,联合分布就是高斯。于是每步随机抽一批单位方向,把嵌入投成一维,再用 Epps-Pulley 检验把经验特征函数对上标准高斯的特征函数。特征函数是密度的傅里叶变换,对每个投影点都有界,梯度也有界,不像高阶矩那样炸。矩匹配用有限阶不可辨识,CDF 检验要排序、难分布式,所以最后留下这一家。
训练时每步重采样方向。固定 16 个方向、每步换新,覆盖面可以超过固定几千个方向。推荐默认 1024 个切片、积分区间 [-5, 5]、17 个梯形积分点。预测项很简单:两张全局视图的嵌入取均值当中心,其余视图往这个中心靠,平方误差。总损失是 (1-λ)×预测 + λ×SIGReg,推荐 λ=0.05。没有 predictor、没有 stop-gradient、没有教师网络,核心大约 50 行 PyTorch,复杂度随 batch 线性。
ImageNet-1k 冻结骨干线性探针,摘要给出 ViT-H/14 的 79%。正文里 ViT-Large(0.3B) 在线探针 77.1%,ConvNeXtV2-Huge(0.6B) 78.5%,预训练 100 个 epoch。ViT-Large/14 同一配方下,batch 128 仍有 72.20%,batch 512 到 74.72%。ImageNet-10 上从 timm 抽了约 50 个小于 20M 参数的模型,覆盖 8 个家族,冻结探针落在 91.5% 到 95%。1.8B 的 ViT-g 训练曲线不炸。
训练损失和下游准确率的 Spearman 相关,ViT-base 在 ImageNet-1k 上是 94.52%;按 λ 的幂次校正、指数约 0.4 时,多组设置能到约 99%。无标签的模型选择第一次有了能用的代理。
域内预训练是这篇真正想卖的点。Galaxy10 只有约 1.1 万张星系图,和自然图像差得很远。
| 方法 | 设置 | Galaxy10 |
| LeJEPA ResNet-34 域内 | 冻结 / 全量微调 | 78.17% / 83.28% |
| DINOv2 ViT-S/16 迁移 | 冻结 / 全量微调 | 67.62% / 78.34% |
| I-JEPA ViT-H/14 迁移 | 冻结, ImageNet-22k | 62.93% |
少样本表里,LeJEPA ViT-L 只训 100 epoch,全样本八数据集平均 79.48%,I-JEPA ViT-H 训 300 epoch 是 78.50%。细粒度(DTD、flowers、food)LeJEPA 更好,CIFAR 上 I-JEPA 更好。换到 flowers102、CIFAR、Food101 这些自然图像,630M 的 I-JEPA 迁移仍然明显更强。
给正在训自监督视觉模型的人,这是一套能换骨干、换数据、几乎不用重搜超参的目标。教师网络和 stop-gradient 可以先拿掉,看 SIGReg 能不能撑住。小领域、分布和 ImageNet 差得远时,与其搬 DINOv2,不如直接在目标数据上跑 LeJEPA。损失和探针相关这件事,对没标签预算的预训练循环也有用。
这不是把 DINOv2 从自然图像王座上掀下去。自然图像大数据上,迁移过来的大模型照样更强。它证明的是:目标函数一旦写对,域内自监督可以在小数据上打过泛化迁移。
论文没有单独的 Limitations 节。摘要写「无需超参日程」,实验仍用了学习率 warmup 加余弦退火;「启发式免费」也还留着 λ、切片数、多裁剪视图。ImageNet-100 的消融里,ViT 加上 SWA 仍有几个点的收益,教师-学生不再是防塌缩的刚需,但不是完全没作用。
理论最优说的是「下游任务未知时的最坏风险」,不是任意已知任务的贝叶斯最优。Table 5 把这件事写得很清楚:自然图像上大模型迁移仍然赢,星系这种跨域数据上域内小模型才赢。ImageNet-1k 的 79% 和当代 DINOv2/v3 同规模数字比,论文没有放一张对齐训练预算的总表,不好直接称全面持平。1.8B 的 ViT-g 只展示了训练不炸,没有给出对应的探针数字。