新论文用冻结 ViT 特征拆分视频中的相机与物体运动

FunAILab · hf · 2026-07-24

论文在做什么

作者研究如何从冻结的图像 ViT 特征中恢复结构化的视频运动表示,把视频里的相机运动和物体运动分开建模。

方法

他们提出 Structured Dynamics Model (SDM):不用把视频变化压成一个纠缠的隐变量,而是通过未来特征预测把主要时间变化与残余动态显式拆分。

训练与评测

结果

论文显示,SDM 优于基于全局 CLS 或平均池化特征的基线;在多个 probe 上,它甚至能以明显更弱的监督,和 VGGT 这类强监督表示打得有来有回。

结论

这项工作说明,预训练图像模型可以被直接改造成结构化的视频动态表示,为视频理解提供更好的归纳偏置。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →