北邮研究揭示视频扩散模型违反物理的根源:RoPE 注意力衰减锁死轨迹
BUPT-CIST · hf · 2026-09-22
北邮团队发布首个针对文生视频扩散模型「运动规划」过程的可解释性研究,从内部机制找出物理违规的根因:- 发现早期去噪阶段即形成运动轨迹(「先形状后细节」),结合 cross-attention 轨迹模式与因果头贡献,定位驱动运动规划的特定注意力头子集
- 自注意力分析显示 RoPE 引发过度的空间注意力衰减,使早期候选区域过早锁定在物理不合理位置,抑制相邻帧的合理轨迹,触发生成失败
- 提出轻量架构修改:按去噪步骤缩放 RoPE 频率,缓解注意力衰减,让模型探索更好的候选区域以建立连贯物理运动
- 无训练与有训练实验均验证可提升生成视频的物理常识
「多模态」频道最新
- Hunyuan Image 3.5 上线 OnSolo:5 张参考图、2K 输出、1 积分一次 — LearnWithBishal · 2026-09-22
- Reddit 求实测:开源 LongCat-Video 生成 10 秒视频各 GPU 要多久 — Clean_Extreme_3970 · 2026-09-22
- 腾讯 ARC 发布 WorldCrafter:隐式 3D 记忆让视频世界模型分钟级探索保持一致 — TencentARC · 2026-09-22
- Grok 4.7 在 Blender 里搞出创作,一段演示引发围观 — iamfakhrealam · 2026-09-22
- Kyutai 发布语音原生推理模型 Voice of Reason,GSM8K 达 77.1% — alexcovo_eth · 2026-09-22
- 24G 内存 MacBook 跑 Qwen-Image 本地生图:一张要 5-6 分钟 — vista8 · 2026-09-22