新论文用冻结 ViT 特征拆分视频中的相机与物体运动
FunAILab · hf · 2026-07-24
论文在做什么
作者研究如何从冻结的图像 ViT 特征中恢复结构化的视频运动表示,把视频里的相机运动和物体运动分开建模。
方法
他们提出 Structured Dynamics Model (SDM):不用把视频变化压成一个纠缠的隐变量,而是通过未来特征预测把主要时间变化与残余动态显式拆分。
训练与评测
- 在真实视频上做自监督学习
- 结合来自合成 Kubric 数据的弱监督
- 提出新的评测套件 ProbeMotion,覆盖合成与真实视频中的相机运动、物体运动和混合动态
结果
论文显示,SDM 优于基于全局 CLS 或平均池化特征的基线;在多个 probe 上,它甚至能以明显更弱的监督,和 VGGT 这类强监督表示打得有来有回。
结论
这项工作说明,预训练图像模型可以被直接改造成结构化的视频动态表示,为视频理解提供更好的归纳偏置。
「研究」频道最新
- 研究显示 OpenHandsDev 在四种编程智能体框架中最省电 — rajistics · 2026-07-24
- LAVE 用前瞻验证让 diffusion LLM 解码更可靠 — jiqizhixin · 2026-07-24
- 机械可解释性被玩成梗:大模型里装着所有 meme — menhguin · 2026-07-24
- Enhanced PubMed MCP 服务器新增摘要和 PMC 全文检索 — modelcontextprotocol · 2026-07-24
- 视觉语言动作系统仍可能错过下一个动作 chunk — StillThese3747 · 2026-07-24
- PRO-LONG 用完整行动日志,让长程智能体在 ARC-AGI-3 提升 18 分 — rohanpaul_ai · 2026-07-24