arXiv 论文揭秘:RoPE 空间偏置导致视频扩散模型违反物理规律
udmrzn · x · 2026-09-24
一篇新 arXiv 论文首次对文生视频扩散模型的「运动规划」过程做可解释性研究,解释为什么 SOTA 视频模型常生成违反物理的内容。
核心发现:
- 运动「先定形状、后补细节」:运动轨迹在去噪早期阶段就基本确定。
- 少数特定注意力头(cross-attention 轨迹模式 + 因果头贡献分析定位)负责规划运动。
- 自注意力分析显示 RoPE 引入过强的空间注意力衰减,使早期候选区域过早锁死在物理上不合理的位置,压制相邻帧的合理轨迹,触发翻车模式。
解法:提出一种轻量架构修改——在不同去噪步缩放 RoPE 频率,缓解过度注意力衰减。免训练与带训练实验均验证可提升物理一致性,无需外部先验或专门数据。
所属事件:研究揭示视频扩散模型违反物理的根源(2 条相关)→
「多模态」频道最新
- Google AI Studio 上线新文生语音模型,支持德语等多语言 — sachinmaya1980 · 2026-09-24
- AI视频智能体Pexo实测:对话式迭代把网址变成发布级宣传片 — HeyZoyaKhan · 2026-09-24
- MiniMax H3 时装视频实测:h3.c 让 M5 Max 出片提速 2-3 倍 — MindfulPornographer · 2026-09-24
- Runway 模型直接嵌入 DaVinci Resolve,剪辑时间线内生图剪辑 — runwayml · 2026-09-24
- 用 Mitte 低模式轻松让角色「住进」酒店大堂视频模板 — mso96 · 2026-09-24
- AI 生成的「口红笑话」短片走红 Reddit — Klitolovac · 2026-09-24