Preserving Unstable Modes Through Inverse Dynamics in JEPA World Models
Leonardo F. Toso, Yann LeCun, James Anderson, Oumayma Bounou
cs.LG, cs.RO, eess.SY, math.OC
2026-10-06
JEPA 下一步预测加 SIGReg 能在损失最小时丢掉全部不稳定模态,端点逆动力学从首尾隐状态还原动作后,把 CartPole 潜空间 LQR 成功率从 0% 拉到 100%。
足式机器人和四旋翼停在不稳定平衡附近,小扰动不立刻纠正,偏差会越滚越大。从图像做控制,要先把像素压进低维隐状态再规划动作。JEPA(联合嵌入预测架构)不重建像素:编码器出隐状态,预测器推下一步,再用抗坍缩正则,免得所有观测被压成一点。这里用 SIGReg,把隐变量分布往各向同性高斯上拉。
分布还有方差,不等于该留给反馈的方向还在。不稳定模态是特征值模长不小于 1 的方向。杆立着的时候,倾角不在表征里,反馈就接不住。Lemma 1:存在只用隐状态的因果控制器并渐近镇定线性系统,当且仅当编码器保住全部不稳定模态和临界稳定模态。这是可检测性。
Lemma 2 给出反例。编码器只读稳定子系统,预测器把它复制准确,一步误差可以是 0;稳定坐标白化后隐变量成标准高斯,SIGReg 也达到最小。训练目标对任意正则权重都能降到底,不稳定子空间却整段落在编码器核里。
反例用线性编码器,压缩不多。图 2 的合成线性系统和线性化 CartPole 上,SIGReg 的主方向对不齐真实不稳定特征向量,潜空间 LQR 发散;EP-IDM 对齐之后,同一套 LQR 能拉回。
加上的损失是端点逆动力学(EP-IDM)。预测目标仍是单步(1SP)或自回归多步(MSP),让预测隐状态对齐编码后的真实隐状态。EP-IDM 只看窗口首尾两个隐状态,还原中间整段动作,训练时用它换掉 SIGReg。另两种变体是相邻隐状态还原单步动作,以及用整条隐轨迹还原动作。
H 步内动作能碰到的状态方向组成可达子空间。Theorem 1:动作在几乎每个初态下都有一块开集那么丰富,且仿射逆模型把动作损失做到 0,编码器在可达子空间上单射,这些方向丢不掉。原系统可镇定、观测可观测、H 够长时,不稳定子空间含在可达子空间里,可检测性成立。动作序列维数高于隐维时精确还原做不到,实验里这项是软约束。
可控性格拉姆矩阵把各方向的控制能量加总。H 变长时不稳定方向的能量指数占优,其主特征子空间收敛到不稳定子空间(Theorem 2),条件是能量至少按 α^{2H} 增长且耦合不抵消。单位圆特征值除外。
编码器输入连续两帧、帧差和本体感觉。CartPole 用平衡点处线性化的预测器做 LQR;CEM 采样滚动,GBP 反传终点隐代价,两者都反复重规划。Walker2D 用 iCEM。
潜空间 LQR 直接检验局部线性化里有没有不稳定模态。CartPole 以 300 步后状态范数不超过 0.7 为成功,MFS 是满足该阈值的步数比例。
| 方法 | LQR 成功率 | MFS | CEM | GBP |
| 真动力学 | 100% | 1.000 | 100% | 100% |
| 1SP + SIG | 0% | 0.202 | 100% | 90% |
| MSP + SIG | 0% | 0.247 | 100% | 100% |
| 1SP + EP-IDM | 100% | 0.999 | 100% | 100% |
| MSP + EP-IDM + SIG | 100% | 0.996 | 100% | 100% |
图 4 中 SIG 的状态范数无界增长,EP-IDM 压回平衡点并维持。CEM、GBP 在 SIG 模型上仍有 90% 到 100%:它们搜的是有限长非线性滚动,不靠局部线性化含不含那个模态。
Walker2D 检查行走极限环能不能留下来。SAC 策略闭环滚 500 步,1SP+EP-IDM 的右髋相图保留周期和幅度,两种 SIG 训练散掉;解码到图像后也只有 EP-IDM 还在走。iCEM 规划十次平均,EP-IDM 速度 2.91 m/s、位移 9.15 m,真动力学是 3.61 m/s、14.43 m;1SP+SIG 只有 0.08 m/s、0.06 m,MSP+SIG 为 0.46 m/s、0.66 m。结束时躯干高度分别是 EP-IDM 0.92 m、真动力学 1.21 m。
PointMaze 开环稳定,用来看逆动力学会不会伤到本来不必镇定的系统。从零训练的动作还原变体,CEM 至少 90%,LQR 至少 70%。MSP+SIG 为 CEM 90%、LQR 60%、GBP 100%。真动力学 CEM 100%、LQR 80%、GBP 90%,GBP 因环境不可微,用 SPSA 每步两次滚动估梯度。冻结 DINOv2 配 MSP 降到 CEM 50%、LQR 20%;iBOT 配 MSP 为 CEM 100%、LQR 80%、GBP 80%。
图 9 上,1SP+EP-IDM 的 LQR 稳住几乎全部测试初值,平衡点附近 Lyapunov 差分为负;MSP+SIG 只覆盖一小块邻域。
预测准、隐变量不坍成常数,推不出不稳定模态还在。损失可以很低,局部反馈仍然看不见该纠正的方向。
EP-IDM 只多一项:用首尾隐状态还原整段动作。CartPole 潜空间 LQR 从 0% 到 100%,MFS 从 0.202、0.247 到 0.996、0.999,贴近真动力学的 1.000。靠平衡点线性反馈做视觉镇定,抗坍缩正则替不了它。
PointMaze 上 SIG 的 CEM 已有 90%。CartPole 上 SIG 的 CEM/GBP 也能成功。缺陷集中在局部线性反馈,采样重规划绕得开。补上的是可检测性,不是新规划器。
理论停在线性系统。图像实验只显示非线性任务上现象还在,没有证明。零损失要求动作够丰富,且动作序列维数不超过隐维;隐维不够时实验用的是软约束,和定理有缝。α^{2H} 的能量下界、耦合不抵消、排除单位圆特征值,三件事都没在视觉任务上核对。
Walker2D 位移 9.15 米对真动力学 14.43 米,结束高度 0.92 米对 1.21 米。相图要先用 MLP 把隐状态解回物理量。终点代价写明偏简单,Walker 规划另接解码器。
十次试验。CartPole 上 SIG 的 CEM/GBP 已经成功,下游若只做采样重规划,模态丢失不一定看得到。PointMaze 上冻结 DINOv2 远弱于从零训练和 iBOT,差距没有解释。