Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms
Yueyan Li, Haibo Wang, Caixia Yuan, Xiaojie Wang
cs.CV, cs.LG
2026-09-20
北邮发现Wan2.1视频扩散的物理错误来自RoPE空间衰减过早锁死轨迹。只改前五步的频率缩放,VideoPhy总体物理常识从29.45%升到39.94%,再叠加LoRA和提示改写到62.68%。
视频扩散已经能出好看的运动,但篮球半空弹、反重力漂、突然冻住仍然常见。现有修法是外挂物理仿真、改写提示、加物理专题数据。这些能抬分,却没回答模型内部到底在哪一步把轨迹选错了。
北邮把问题收窄到固体动力学:物体从第0帧到最后一帧的连续位移,在Wan2.1-T2V里是怎么被规划出来的,又为什么会规划出违反力学的路径。
分析主模型是Wan2.1-T2V-1.3B,50步去噪,主案例提示是白背景下篮球自由落体再弹起。更大的14B在物理上并不更好,所以主实验停在1.3B。
先看cross-attention,它是条件语义进入视频latent的唯一入口。对「basketball」这类物体token的注意力图显示:第1步还是噪声,第3步每帧出现多个高亮候选区,大约第5步收敛到最终位置,第7步轨迹已经清晰。注意力熵和支持质量(与最终轨迹掩膜的重叠)都在第5步附近跳变。
有轨迹图案不等于负责运动规划。他们用因果干预给每个头打贡献分,再按收敛速度分成四类。真正一挖就让轨迹塌掉的,是既有清晰轨迹图案、贡献又高的那一小撮头。早期第0、1层的头更像在初始化外观,挖掉它们物体甚至不位移。只看轨迹图案、贡献却接近零的头,挖了轨迹几乎不动。
再看self-attention。多数头并不沿着轨迹看,而是钉在各帧的同一空间位置,论文称为RoPE的空间锚定:高、宽方向的旋转位置编码让相对距离大的token点积衰减,帧与帧之间更愿意对齐「同一块像素」。早期候选区互相竞争,少数帧先锁死位置,邻帧被锚定拉过去。如果先锁死的是半空中那个不合理点,更合理但空间更远的候选会被压掉,于是出现空中弹跳或悬停。
改法很轻:只在去噪前几步把高、宽RoPE频率乘上λ<1(训练默认收到0.75),减慢空间衰减,让模型多看一会儿别的候选。训练还把前10%时间步的采样概率提高,LoRA主要打在注意力上。
VideoPhy 343条测试,报语义遵循(SA)和物理常识(PC)。
| 方法 | 总体SA | 总体PC | 固体-固体PC |
| Wan2.1-T2V-1.3B | 53.64 | 29.45 | 24.52 |
| 提示改写 | 80.47 | 44.31 | 28.88 |
| LoRA | 55.69 | 35.57 | 27.95 |
| VideoREPA | 56.56 | 37.90 | 30.61 |
| 改RoPE | 57.43 | 39.94 | 32.60 |
| LoRA+改RoPE | 64.72 | 41.98 | 35.39 |
| LoRA+改RoPE+提示改写 | 87.46 | 62.68 | 50.61 |
提示改写主要抬SA;RoPE缩放在PC上超过单独LoRA和VideoREPA,固体相关子集更明显,流体-流体运动幅度小,收益也小。篮球自由落体上,无训练的λ需要手调;LoRA适应之后,固定λ能改善其他随机种子的轨迹。只调注意力、不动FFN,物理变好且不伤观感,失败更像出在注意力而不是记忆层。
想让视频模型懂物理的人,多数在加数据或外挂仿真。这篇把失败定位到去噪前几步的空间RoPE,用一个缩放系数就能动PC,说明至少有一部分「反物理」是位置编码的归纳偏置,不是单纯缺物理语料。和提示改写可叠加:改写管听指令,缩放管别过早锁位置。
对Wan系DiT最直接。别的RoPE视频模型能不能同样改,论文标成未来工作。
主分析围着一个篮球下落案例和固体动力学,光学、热、材料几乎没碰。λ仍要选,无训练时对种子敏感。VideoPhy的SA/PC是二值自动指标,不是轨迹误差的毫米级测量。14B只给了附录可视化,没有一张和1.3B对齐的全表。I2V和少步自回归扩散被点名但没做。因果归因用的是速度预测上的patching,对「物理正确」的代理不等于对最终像素的代理。