Wan视频模型物理翻车,根因是RoPE空间衰减过早锁死轨迹

Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms

Yueyan Li, Haibo Wang, Caixia Yuan, Xiaojie Wang

cs.CV, cs.LG

2026-09-20

北邮发现Wan2.1视频扩散的物理错误来自RoPE空间衰减过早锁死轨迹。只改前五步的频率缩放,VideoPhy总体物理常识从29.45%升到39.94%,再叠加LoRA和提示改写到62.68%。

这篇在解决什么

视频扩散已经能出好看的运动,但篮球半空弹、反重力漂、突然冻住仍然常见。现有修法是外挂物理仿真、改写提示、加物理专题数据。这些能抬分,却没回答模型内部到底在哪一步把轨迹选错了。

北邮把问题收窄到固体动力学:物体从第0帧到最后一帧的连续位移,在Wan2.1-T2V里是怎么被规划出来的,又为什么会规划出违反力学的路径。

方法

分析主模型是Wan2.1-T2V-1.3B,50步去噪,主案例提示是白背景下篮球自由落体再弹起。更大的14B在物理上并不更好,所以主实验停在1.3B。

先看cross-attention,它是条件语义进入视频latent的唯一入口。对「basketball」这类物体token的注意力图显示:第1步还是噪声,第3步每帧出现多个高亮候选区,大约第5步收敛到最终位置,第7步轨迹已经清晰。注意力熵和支持质量(与最终轨迹掩膜的重叠)都在第5步附近跳变。

有轨迹图案不等于负责运动规划。他们用因果干预给每个头打贡献分,再按收敛速度分成四类。真正一挖就让轨迹塌掉的,是既有清晰轨迹图案、贡献又高的那一小撮头。早期第0、1层的头更像在初始化外观,挖掉它们物体甚至不位移。只看轨迹图案、贡献却接近零的头,挖了轨迹几乎不动。

再看self-attention。多数头并不沿着轨迹看,而是钉在各帧的同一空间位置,论文称为RoPE的空间锚定:高、宽方向的旋转位置编码让相对距离大的token点积衰减,帧与帧之间更愿意对齐「同一块像素」。早期候选区互相竞争,少数帧先锁死位置,邻帧被锚定拉过去。如果先锁死的是半空中那个不合理点,更合理但空间更远的候选会被压掉,于是出现空中弹跳或悬停。

改法很轻:只在去噪前几步把高、宽RoPE频率乘上λ<1(训练默认收到0.75),减慢空间衰减,让模型多看一会儿别的候选。训练还把前10%时间步的采样概率提高,LoRA主要打在注意力上。

结果

VideoPhy 343条测试,报语义遵循(SA)和物理常识(PC)。

方法总体SA总体PC固体-固体PC
Wan2.1-T2V-1.3B53.6429.4524.52
提示改写80.4744.3128.88
LoRA55.6935.5727.95
VideoREPA56.5637.9030.61
改RoPE57.4339.9432.60
LoRA+改RoPE64.7241.9835.39
LoRA+改RoPE+提示改写87.4662.6850.61

提示改写主要抬SA;RoPE缩放在PC上超过单独LoRA和VideoREPA,固体相关子集更明显,流体-流体运动幅度小,收益也小。篮球自由落体上,无训练的λ需要手调;LoRA适应之后,固定λ能改善其他随机种子的轨迹。只调注意力、不动FFN,物理变好且不伤观感,失败更像出在注意力而不是记忆层。

为什么重要

想让视频模型懂物理的人,多数在加数据或外挂仿真。这篇把失败定位到去噪前几步的空间RoPE,用一个缩放系数就能动PC,说明至少有一部分「反物理」是位置编码的归纳偏置,不是单纯缺物理语料。和提示改写可叠加:改写管听指令,缩放管别过早锁位置。

对Wan系DiT最直接。别的RoPE视频模型能不能同样改,论文标成未来工作。

局限与存疑

主分析围着一个篮球下落案例和固体动力学,光学、热、材料几乎没碰。λ仍要选,无训练时对种子敏感。VideoPhy的SA/PC是二值自动指标,不是轨迹误差的毫米级测量。14B只给了附录可视化,没有一张和1.3B对齐的全表。I2V和少步自回归扩散被点名但没做。因果归因用的是速度预测上的patching,对「物理正确」的代理不等于对最终像素的代理。

术语

原文与代码

相关论文

全部论文解读