VISReg 用切片 Wasserstein 正则化解决表征坍塌
新智元 · wechat · 2026-07-28
这篇公众号文章介绍了一个新的自监督学习方法 VISReg(Variance-Invariance-Sketching Regularization),目标是解决 JEPA/world model 路线里长期存在的 表征坍塌 问题。
这项工作解决什么问题
- 它继承了 VICReg 和 SIGReg 的思路,但试图修复两个关键缺陷:
- 坍塌时梯度会变弱甚至消失;
- “尺度”和“形状”两个目标纠缠在一起,优化不稳定。
- VISReg 把正则项拆成三部分:中心化损失、方差/尺度损失、以及基于 切片 Wasserstein 距离 的形状损失。
- 核心做法是用 stop-gradient 把尺度和形状彻底解耦,避免二者互相干扰。
方法上的关键点
- 作者强调,VISReg 在模型已经开始坍塌时仍然能保留较强梯度,比 SIGReg 更容易“拉回来”。
- 通过随机投影后的切片 Wasserstein,方法不仅约束二阶统计量,而是更完整地刻画分布形状。
- 文章还提到实现非常轻量,核心正则项大约只需要 15 行 PyTorch。
实验结果
- 在 15 个数据集 上,VISReg 在很多场景里超过或接近多种主流自监督方法。
- 在 OOD 泛化上表现尤其强,有些设置下用大约 1/10 的训练数据就能追平 DINOv2 的 OOD 水平。
- 它在语义分割、特征引导生成,以及长尾/低秩数据上也表现出不错的鲁棒性。
整体来看,这篇文章把 VISReg 描述成一种更稳定、理论更清晰的自监督表征学习方案。
「研究」频道最新
- Reddit 用户用 LoRA 和 ComfyUI 做出 Wan 2.2 连续生成流程 — SnooMacaroons1365 · 2026-07-28
- Kimi K3 复现 RLVR 研究结论且不乱下结论 — infoxiao · 2026-07-28
- 中科院论文梳理基础模型长程规划的形成与蒸馏机制 — CASIA · 2026-07-28
- 首个机器人三视角世界模型榜单 TriWorldBench 发布 — 机器之心 · 2026-07-28
- Lean 形式化证明了 Feige 猜想的 $\delta\ge 1$ 情形 — RexDouglass · 2026-07-28
- 120 张标注图训练出一个 5MB 的 McBess 风格 LoRA — Winter_unmuted · 2026-07-28