研究揭示视频扩散模型违反物理的根源

北邮团队在 arXiv 发表首个针对文生视频扩散模型「运动规划」过程的可解释性研究,解释了 SOTA 视频模型为何常生成违反物理的内容。研究发现运动遵循「先定形状、后补细节」:轨迹在早期去噪阶段即已形成,而 RoPE 注意力的空间偏置与衰减特性会锁死轨迹,结合 cross-attention 机制导致后续无法修正,最终产生违反物理规律的运动。

2026-09-22 ~ 2026-09-24 · 2 条相关