MotionForesight 预测未来3D运动
MotionForesight 是一项把现成视频模型“改用途”来预测未来 3D scene flow 的工作,而不是从零重训一个新大模型。它的设定是:模型只看短视频前半段的已观测内容,就要推断后续画面里的 3D 运动;作者还称,该方法能从训练集泛化到家庭、办公室等新场景,因此值得关注。
关键做法
作者把每段交互视频切成“已观测”和“未来”两段。训练时,模型输入只有前半段的 RGB 与几何信息;完整视频则先离线处理,恢复物体 mask、度量几何、相机运动和稠密 3D tracks,并把这些结果作为伪真值监督。未来帧本身只作为监督目标,不直接喂给模型。
模型基础与训练信号
按帖子转述,MotionForesight 从 TrackCraft3r 出发,而 TrackCraft3r 又建立在 Wan2.1 之上。作者的核心判断是,预训练视频模型已经学到“交互如何展开”的时间先验,因此不必重训完整模型,只需用轻量 LoRA 适配到“预测未来运动”这个目标。训练监督来自离线处理后的 4 万条 Something-Something-V2 互动视频。
泛化与发布
作者称,这一方案不只适用于 Something-Something-V2,还在他们自行采集的家庭、办公室短手机视频上表现不错,重点是展示跨场景泛化能力。相关论文、项目主页和代码已经放出。
2026-07-18 ~ 2026-07-18 · 6 条相关
- MotionForesight:预测未来3D运动 — mangahomanga · 2026-07-18
- 复用视频模型的时间先验 — mangahomanga · 2026-07-18
- 轻量LoRA学会预测未来运动 — mangahomanga · 2026-07-18
- 用4万视频离线构建训练监督 — mangahomanga · 2026-07-18
- 方法可泛化到家庭办公室场景 — mangahomanga · 2026-07-18
- 论文、代码与项目主页已放出 — mangahomanga · 2026-07-18