DSReg: Provably Recovering Individual World Latents without Reconstruction
Yujia Zheng, David Klindt, Randall Balestriero, Bernhard Schölkopf
cs.LG, cs.AI, cs.RO, stat.ML
2026-10-07
在只差一个旋转的 JEPA 表示上,DSReg 按依赖稀疏再转一次,把每个世界因子拆到只剩正负号;15 个种子的像素编码器追平有标签对照,稠密预测不变。
JEPA(joint-embedding predictive architecture,在表征空间里预测下一状态的嵌入,不重建像素)可以预测得很好,学到的维度仍可能是多个因子的混合物。LeJEPA 在标准高斯隐状态和平稳加性噪声转移下证明,对齐损失下界是 2(1−ρ)d,ρ 是相邻隐状态的相关,取等当且仅当表示是真值的正交变换 h(z)=Qz。
各向同性高斯的密度只看模长,旋转不改变分布。只看分布的准则因此分不出杯子位置和刀的位置是否搅在同一维度。稠密预测可以不动,改这一个维度却会把刀一起带走。非线性 ICA 和因果表征学习拆开因子时,靠解码器、似然、辅助变量、非高斯或干预。这些锚在 JEPA 里都没有。
足迹 Si 是一个隐变量的偏导在正测度集上非零的那些观测坐标。结构多样性(Structural Diversity)只要求足迹两两不同,重叠和嵌套都允许。全局光照包住局部物体时,非包含和结构稀疏失败,它仍然成立。命题 1 说明,这些旧条件连同结构变异都严格更强。足迹完全相同的那一对,单靠支撑分不开。
LeJEPA 把正交类定住之后,DSReg(Dependency-Sparsity Regularization,依赖稀疏正则)再搜一个旋转,把依赖支撑压到最稀疏。定理 2 加上函数型不抵消:活跃偏导不得互相抵消。最小值就是符号置换,每个估计维度等于某个真值维度乘上 ±1。
编码器保持冻结。
ℓ1 既罚幅度也罚个数,有可能和精确支撑计数选出不同的旋转。图 8 上精确计数至少一样好,再用计数细化能补上缺口。回归不训解码器,也不优化重建。事后拟合和联合训练恢复相当,联合头在补完之前略差(附录表 2)。
一块 48GB GPU 上,隐维度到 8192,样本到 10^6,观测维到 2^17,单步代价基本持平。定理 3 给出噪声余量:阈值与雅可比误差之和低于信号强度和模式间隔的乘积时,最小值落在符号置换附近。
稠密 R² 看状态是否还在张成里,MCC 看一一对应。对照是旋转前的同一表示。视觉编码器 5 到 15 个种子,其余 10 到 20 个。
| 设置 | 对照 | DSReg |
| 嵌套足迹合成观测,20 次 | LeJEPA 仍混合 | 各维度接近天花板 |
| 足迹完全相同 | 个体恢复不可能 | pair-span CCA 为 1.00 |
| 像素编码器,15 个种子 | PCA、Varimax、FastICA | 追平看见标签的最优正交对齐 |
| 真值维 8,估计维加到 32 | 同一个有标签对齐 | 差距在 0.001 以内,5 个种子 |
合成观测的足迹逐层嵌套,旧的结构条件会排除这一档。同一批估计隐变量上,PCA、Varimax 和 FastICA 都拆不开(附录表 5),起作用的是雅可比依赖。图 3b 在 h=Qz 的解析轨道上核对命题 1,N=16。足迹不同就接近完美,嵌套档一样干净;足迹相同则只保住子空间。
六个探针含视觉编辑、稀疏控制、短程预测和意外检测,环境是 TwoRoom、FetchSlide 和 PushT。每一项都更好,几乎每次运行都赢,稠密张成保持对齐(附录表 6)。从像素训练之后,三个探针的每一次运行都是 DSReg 在前。高斯 3DShapes 从混合升到接近天花板,稠密 R² 与旋转前对齐。四分之一朝向的 dSprites 上,线性前提只部分达到,DSReg 仍好过扫过 β 的 β-VAE 和 β-TCVAE,上界由这个前提决定。正文未给逐条差值。
检查点冻住即可,只拟合一个正交头,稠密读出不用重训。一次只动一个因子的控制、编辑和监视,改接旋转之后的坐标。
嵌套足迹在这里仍然可识别。文中称之为第一个不靠重建、标签或非高斯、又能逐个恢复隐变量的 JEPA。
正交类来自高斯世界上的 LeJEPA。前提没到齐,后面就没有干净的类可以搜。
基准是模拟或渲染出来的,没有物理机器人上的实验。足迹相同的因子,支撑单独分不开,补救被放在时间结构或低成本干预上。高斯隐世界只是立足点,保证的范围随线性可识别一起变。
默认优化的是 ℓ1。它和精确支撑计数可能选出不同的旋转;计数至少一样好写在图 8,不是主实验的默认。定理 3 只管加了阈值的总体准则,有限样本的噪声对照不在正文。自然视频里足迹是否两两不同,这篇没有检验。观测向量在拟合前指定,编码器也可丢掉底层细节。