MotionForesight 预测未来3D运动

MotionForesight 是一项把现成视频模型“改用途”来预测未来 3D scene flow 的工作,而不是从零重训一个新大模型。它的设定是:模型只看短视频前半段的已观测内容,就要推断后续画面里的 3D 运动;作者还称,该方法能从训练集泛化到家庭、办公室等新场景,因此值得关注。

关键做法

作者把每段交互视频切成“已观测”和“未来”两段。训练时,模型输入只有前半段的 RGB 与几何信息;完整视频则先离线处理,恢复物体 mask、度量几何、相机运动和稠密 3D tracks,并把这些结果作为伪真值监督。未来帧本身只作为监督目标,不直接喂给模型。

模型基础与训练信号

按帖子转述,MotionForesight 从 TrackCraft3r 出发,而 TrackCraft3r 又建立在 Wan2.1 之上。作者的核心判断是,预训练视频模型已经学到“交互如何展开”的时间先验,因此不必重训完整模型,只需用轻量 LoRA 适配到“预测未来运动”这个目标。训练监督来自离线处理后的 4 万条 Something-Something-V2 互动视频。

泛化与发布

作者称,这一方案不只适用于 Something-Something-V2,还在他们自行采集的家庭、办公室短手机视频上表现不错,重点是展示跨场景泛化能力。相关论文、项目主页和代码已经放出。

2026-07-18 ~ 2026-07-18 · 6 条相关