VISReg:改进自监督表征坍塌

机器之心 · wechat · 2026-07-14

这篇文章介绍了自监督学习新工作 **VISReg**(Variance-Invariance-Sketching Regularization),作者之一 Haiyu Wu 来自 Altos Labs,论文得到 Yann LeCun 公开转发认可。 ## 这项工作要解决什么 VISReg 主要针对 JEPA/自监督训练中的 **表征坍塌** 问题。作者指出,现有方法要么依赖一堆训练技巧(EMA、teacher-student、stop-grad 等),要么像 SIGReg 一样在坍塌时梯度会变弱,难以把模型拉回正常状态。 ## 核心方法 VISReg 把正则拆成三个部分: - **尺度约束**:用方差项控制每一维的幅值,坍塌时仍能提供稳定梯度; - **形状约束**:先对特征归一化并对标准差做 stop-gradient,再用切片 Wasserstein distance 约束分布形状; - **中心化损失**:把 batch 均值拉回原点。 文章强调,这样做的关键是把“尺度”和“形状”彻底解耦,避免二者互相干扰。 ## 结果如何 作者在 15 个数据集上做了比较,覆盖域内、OOD、分割和生成引导: - 在 **OOD 泛化** 上,VISReg 在多个骨干规模上都优于 DINO、MoCoV3、I-JEPA、MAE、data2vec 等; - 用 **ImageNet-22K** 预训练后,OOD 平均表现接近用 **10 倍更多数据** 训练的 DINOv2; - 微调后在 CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10 上都超过 DINO 和监督预训练; - 在 ADE20K 线性分割和 SiT 图像生成引导上,也取得了有竞争力甚至更好的结果。 ## 额外特点 文章还指出,VISReg 的正则计算复杂度是 **O(NDK)**,相比 VICReg 的协方差项 **O(ND²)** 更线性、更适合扩展;实现上也很轻量,核心逻辑只需约 15 行 PyTorch。

所属事件:VISReg 以正则化改进自监督泛化(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →