LeVJEPA 论文:用 SIGReg 防止视频表征坍塌

burkov · x · 2026-08-31

虽然视频包含运动和时间顺序,是比静态图像更丰富的训练信号,但从未标记视频中学习有用表示通常需要大量计算和额外机制来防止「表征坍塌」。这篇来自 AmiLab 等机构的论文探讨了这种复杂性是否必要。

LeVJEPA 通过让同一剪辑不同视角的表征一致来训练单一视频 Transformer,同时使用名为 SIGReg 的统计正则化器来保持学习表征在分布上的分散。这防止了坍塌,且无需第二个编码器、预测网络或特殊的梯度阻断。实际效果显著:模型可在训练期间丢弃 95% 的视频 token。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →