LeVJEPA 论文:用 SIGReg 防止视频表征坍塌
burkov · x · 2026-08-31
虽然视频包含运动和时间顺序,是比静态图像更丰富的训练信号,但从未标记视频中学习有用表示通常需要大量计算和额外机制来防止「表征坍塌」。这篇来自 AmiLab 等机构的论文探讨了这种复杂性是否必要。
LeVJEPA 通过让同一剪辑不同视角的表征一致来训练单一视频 Transformer,同时使用名为 SIGReg 的统计正则化器来保持学习表征在分布上的分散。这防止了坍塌,且无需第二个编码器、预测网络或特殊的梯度阻断。实际效果显著:模型可在训练期间丢弃 95% 的视频 token。
「研究」频道最新
- 挑战极限:训练含大量刚体的 RL 障碍策略 — yacineMTB · 2026-08-31
- 2011 年论文揭示去噪自编码器与扩散模型起源 — cloneofsimo · 2026-08-31
- 中国团队用 PINN 神经网络求解玻色星族,突破传统数值限制 — drscotthawley · 2026-08-31
- SenseNova-Vision:将视觉任务重构为统一多模态生成 — rsasaki0109 · 2026-08-31
- Dietterich 谈论文写作:论文是论证而非过程记录 — tdietterich · 2026-08-31
- 花 $3K 让 AI 搞科研,论文被拒:败在判断力 — rohanpaul_ai · 2026-08-31