首个能外推物理规律的视频世界模型:把运动学写进架构,参数少 26 倍

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang, Xin Lin, Haolin Lu, Zhe Lin, Manmohan Chandraker

cs.CV

2026-08-11

把状态转移写成运动学积分、只学高阶残差的 LDR,在五个物理任务上 ID-OOD 误差差距比 DiT 基线小 20 倍以上,参数少 26 倍、快 143 倍。

这篇在解决什么

视频扩散模型能把下一帧画得很逼真,但不一定遵守运动规律。作者的核心论点是:这些模型学的是「世界长什么样」,而不是「世界怎么演化」。一旦测试场景超出训练分布,它们就会退化成复刻最接近的训练样本,而不是按真实动力学往外推。

作者想区分两类东西:视频生成器(画得像)和视频世界模型(懂得运动规律、能外推)。要评判一个模型到底懂不懂动力学,光看分布内表现没用,大家都画得像;得看它能不能把学到的规律外推到没见过的初始条件上。为此他们在一个白盒物理模拟器(PhyWorld)上建了五个任务,匀速运动、抛体运动、碰撞、弹跳、逼近,并定义了分布内(ID)和分布外(OOD)两套初始条件。两套遵循同样的运动定律,OOD 只是把速度、半径等参数推到训练区间之外,专门用来检验模型是真正学了规律还是死记了像素。

方法

方法叫 Latent Dynamics Reasoning(LDR),思路是:别直接回归下一帧,改成在结构化潜空间里把状态转移写成显式的运动学积分,只让网络学那个高阶残差。

具体分三步。编码:每帧过一个 CNN 得到特征图,再用 marginal soft-argmax 把每个通道压成几何坐标(质心 μ 和展宽 σ),这就是结构化潜表征(structured latent, SL)。它丢掉了外观和语义信息,只留几何结构,让后续的求导和积分更稳。推演:从三帧条件帧用有限差分算出零阶、一阶、二阶潜变量(类比位置、速度、加速度),然后逐步 rollout,网络 fθ(一个 tanh 加 MLP)只回归三阶及以上的残差,低阶部分用固定公式数值积分出来。解码:把预测的潜变量当成对条件帧的形变流,扭出下一帧,而不是从零生成像素。

为什么这样能外推?作者引了一条结论:神经网络在训练分布外的行为由架构的归纳偏置决定,而不是由训练数据决定。一个没有动力学偏置的普通回归器,在分布外会塌回训练均值。LDR 把运动学积分焊死在架构里,强迫模型学「状态怎么演化」,而不是「下一个状态长什么样」,这才有了外推能力。

整个模型一次前向传播就出全部帧,没有扩散采样,也没有测试时优化。

结果

在 256² 分辨率、五个任务平均下来,位置误差的 ID-OOD 差距(单任务训练):

方法ID 误差OOD 误差ID-OOD 差距
DiT-S 基线0.0690.3690.300
LDR0.0440.0570.013

五任务联合训练下:

方法ID 误差OOD 误差ID-OOD 差距
DiT-S 基线0.0860.5920.506
LDR0.0500.0680.018

基线在分布内还行,一出分布误差就爆,联合训练下从 0.086 飙到 0.592;LDR 则把 OOD 压得很接近 ID。单任务和联合训练下,LDR 的差距分别是 DiT-S 的 1/23.9 和 1/27.7,也就是基线的二十到二十七分之一。

效率对比更悬殊:

DiT-S 基线LDR
参数量106.1M4.1M(少 25.9 倍)
256² 延迟5.21s0.036s(快 143 倍)

DiT-S 要跑 50 步 DDIM 采样,每步是一次完整的 transformer 前向,开销随 token 数二次增长;LDR 一次前向出全部帧。

两个组件缺一不可。去掉动力学推理(改成直接回归下一帧潜变量)损伤最大,联合训练下甚至连分布内都崩了,模型分不清五个任务,把一个任务的动力学套到另一个上(比如给匀速运动加向下的拉力),ID 位置误差 0.494 比 LDR 的 0.050 高了一个量级。去掉结构化潜表征(改用稠密卷积特征)也会让差距扩大到 0.133。

分辨率越高 LDR 优势越大。从 128² 到 256²,DiT-S 的 OOD 位置误差从 0.222 涨到 0.592,LDR 的反而从 0.114 降到 0.068。两个方法随分辨率往相反方向走,容量越大,回归器把训练分布拟合得更死,分布外崩得更狠;LDR 反而从更高分辨率里读到更精确的动力学。

压力测试里,LDR 只在红球上训练,却能正确预测皮卡丘、蓝方块、反向运动物体的轨迹,基线全部失败。

为什么重要

这篇给「视频世界模型」这个被用滥的词补上了一个可检验的定义:能不能外推学到的动力学。它证明外推能力来自架构里写死的运动学归纳偏置,而不是来自更大的模型或更多数据。这和 PhyWorld 原文的结论一致,堆规模、堆数据救不了外推。

对做物理仿真、机器人世界模型、具身智能的人,这是一个便宜得多的基座:4M 参数、一次前向,在受控物理任务上比扩散基线小 26 倍、快 143 倍,而且越往外推优势越明显。但它现在的形态离真实场景还远(见下),更像一个原理验证,而不是现成可用的工具。

局限与存疑

作者自己划了三条线。第一,动力学推理对内容是无知的:运动学积分不假设潜变量编码的是什么、也不假设背后的物理定律,所以它本身不会主动学物理。第二,结构化潜表征只编码「结构」不编码「内容」,像颜色随时间变化这种活在外观里的动力学,它抓不到。第三,几何坐标只能处理简单场景,复杂场景的表达力够不够存疑。

更重要的是验证范围。五个任务都是模拟器里的简单刚体运动(球),对象单一、规律干净。把它放大到真实世界视频、多物体交互、更复杂的物理,这套结构化潜表征还成不成立,论文没有回答,作者也明确说是未来工作。所有结果都是 seed 42 单次跑,没有误差棒。

「首个能外推动力学的视频世界模型」这个说法要打折扣。它针对的是 PhyWorld 这套受控物理基准;在更广义的视频生成社区里,JEPA 这类「预测下一潜变量」的方法也在往相近方向走,只是没有显式建模动力学。

术语

原文与代码

社区讨论

相关论文

全部论文解读