Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization
Andy Zeyi Liu, Haoran Sun, Lucas Baker, Randall Balestriero, John Sous
cs.LG, cs.AI, cs.CV
2026-09-10
SG-JEPA 把重力写入动作条件,用折扣多步 rollout 联合训练编码器。二维开环误差最多减半,机械臂接球成功率从 9.5% 提到 23.3%。
JEPA 类世界模型不重建像素,只在潜空间预测下一时刻的表征。DINO-WM 把预训练 DINOv2 冻住,只训一个动作条件预测器;LeWorldModel(LeWM)把编码器和预测器一起训,但损失仍是单步 teacher forcing:预测器每一步都吃真实编码,从不吃自己的输出。
两种做法都默认环境的转移律固定。换一组重力,自由落体变成漂浮,弹跳变成急坠,同一条物理定律会走出完全不同的轨迹。要分清的是:模型学到的是「这组重力下的转移」,还是「重力如何进入动力学」。
SG-JEPA 在 LeWM 上改了两处。
编码器是从随机初始化训起的 ViT-Tiny(12 层、宽 192),CLS token 投到 256 维。预测器试了 Transformer、GRU、Mamba 风格 SSM 三种,正文默认 GRU 或 SSM。矩阵参数用 Muon、其余用 AdamW,训 20 个 epoch。
评测全在 MuJoCo,每段 64 帧、16 Hz。二维平面刚体的训练重力采样 N(4, 0.5²),三维抛体和机械臂采样 N(9.8, 2.0²)。测试换成更宽的网格,覆盖负重力,以及冥王星、月球、火星、金星四个真实 g。下游分两路:冻住世界模型,用 MLP probe 读位置、速度、转角;冻住编码器,另训一个重力条件 Diffusion Policy,做接球、颠球、把球打进篮子。
名字里的 semigroup:固定 g、无动作时,反复套同一个更新就是离散半群。有动作时每块仍可复合,只是被动作改过。
二维正方形、44 步开环(2.75 秒)相对 DINO-WM:
| 指标 | DINO-WM | SG-JEPA (GRU) |
| 位置 L2 (m) | 2.006 | 1.034 |
| 速度 L2 (m/s) | 3.082 | 1.915 |
| 累计转角 (圈) | 0.341 | 0.236 |
三类误差降 31%–48%,位置接近减半。三角形更难:44 步位置、速度仍是 SG-JEPA 最低,累计转角 DINO-WM 略好(0.875 对 GRU 的 0.904),非对称碰撞会把小误差放大。
三维 Approach Ball,h1 到 h44 平均位置误差:GRU 0.0491 m,DINO-WM 0.0705 m,LeWM 0.0986 m。相对 DINO 大约降 30%,相对 LeWM 大约降 50%。25 个测试重力里 SG-JEPA 赢了 22 个,输掉的几个是极弱重力。速度没有同样整齐的优势,最后一步上 DINO-WM 更准。
控制任务冻编码器、另训 Diffusion Policy:
| 任务 | DINO-WM | SG-JEPA (GRU) |
| Arm Catcher 接住 | 9.5% | 23.3% |
| Franka 打进篮子 | 27.4% | 30.5% |
| Arm Paddle 合格颠球 | 17.7% | 23.8% |
接球大约 2.5 倍,训练重力附近是 42.3% 对 16.0%。打进篮子两边击球都超过 95%,差距出在击中之后的出射速度。
机制上,冻住编码器、重训一个新预测器:GRU 训出来的表征无论接 GRU 还是 Transformer,主指标都低大约 12%(1.376 对 1.555,1.269 对 1.453)。远 OOD 重力上,teacher forcing 局部误差已低约 32%;自由 rollout 把这条缝再放大好几倍,在 20 步附近峰值约 0.38,局部缝不到 0.06。多步损失回传到编码器,逼它留下预测器能带着走、动力学真正依赖的那些特征。
对做世界模型的人,这是一个可复述的配方:物理参数进动作条件,损失从单步改成折扣多步 rollout,收益主要落在表征,不绑死某一种时序骨干。GRU 和 SSM 在不同视界上交替领先,说明这件事对预测器结构不敏感。
对做控制的人,冻表征再训 Diffusion Policy,就能在训练带以外的重力下接球。但重力是显式喂进去的,不是从像素里估的。想在未知星球上部署,还得先知道当地的 g,或者另做参数推断。
这是受控仿真里的机制验证,不是新的通用世界模型。
作者写了三条。实验只扫一个标量重力,没有矢量物理量,也没有让模型从观测推断参数。形状迁移不齐:三角加方块能带上「房子」刚体的平动,转角带不过去,五边形更难。理论用线性特征模型,真实预测器非线性、依赖历史,碰撞会切转移分支。
读下来还有几处要对齐。引言有一段交叉实验把编码器和预测器的结论写反了,和摘要、第四节不一致,以冻结表征再训预测器那组为准。三角形转角仍输给 DINO-WM。Franka 从 27.4% 到 30.5%,增益薄。全部 MuJoCo,没有真实机器人。训练重力分布很窄,测试网格再宽也还是同一套接触模型和渲染。