VISReg:改进自监督表征坍塌
机器之心 · wechat · 2026-07-14
这篇文章介绍了自监督学习新工作 **VISReg**(Variance-Invariance-Sketching Regularization),作者之一 Haiyu Wu 来自 Altos Labs,论文得到 Yann LeCun 公开转发认可。 ## 这项工作要解决什么 VISReg 主要针对 JEPA/自监督训练中的 **表征坍塌** 问题。作者指出,现有方法要么依赖一堆训练技巧(EMA、teacher-student、stop-grad 等),要么像 SIGReg 一样在坍塌时梯度会变弱,难以把模型拉回正常状态。 ## 核心方法 VISReg 把正则拆成三个部分: - **尺度约束**:用方差项控制每一维的幅值,坍塌时仍能提供稳定梯度; - **形状约束**:先对特征归一化并对标准差做 stop-gradient,再用切片 Wasserstein distance 约束分布形状; - **中心化损失**:把 batch 均值拉回原点。 文章强调,这样做的关键是把“尺度”和“形状”彻底解耦,避免二者互相干扰。 ## 结果如何 作者在 15 个数据集上做了比较,覆盖域内、OOD、分割和生成引导: - 在 **OOD 泛化** 上,VISReg 在多个骨干规模上都优于 DINO、MoCoV3、I-JEPA、MAE、data2vec 等; - 用 **ImageNet-22K** 预训练后,OOD 平均表现接近用 **10 倍更多数据** 训练的 DINOv2; - 微调后在 CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10 上都超过 DINO 和监督预训练; - 在 ADE20K 线性分割和 SiT 图像生成引导上,也取得了有竞争力甚至更好的结果。 ## 额外特点 文章还指出,VISReg 的正则计算复杂度是 **O(NDK)**,相比 VICReg 的协方差项 **O(ND²)** 更线性、更适合扩展;实现上也很轻量,核心逻辑只需约 15 行 PyTorch。
所属事件:VISReg 以正则化改进自监督泛化(2 条相关)→
「研究」频道最新
- 把数据集打包成顺序 blob,训练吞吐提升 30% — irinarish · 2026-07-21
- 一个 C++20 CPU 原生 strict-W1 训练 runtime 寻求反馈 — Wonderful-Income7415 · 2026-07-21
- 微软提出像训练神经网络一样训练 agent 技能 — Saboo_Shubham_ · 2026-07-21
- 研究者:AI 应是放大器,而不是放弃科研的理由 — omarsar0 · 2026-07-21
- 海森矩阵入门:二阶导数如何影响神经网络优化 — burny_tech · 2026-07-21
- 相关 verifier 串联会让 LLM 可靠性卡在 100% 以下 — Jiangang Han · 2026-07-21