物体出画就忘:Cornell测12个4D模型,看不见时记忆骤降

Can 4D Foundation Models Remember?

Guangzhao He, Hadar Averbuch-Elor, Wei-Chiu Ma

cs.CV

2026-09-18

Cornell用360度视频当全知真值做PersistBench,测12个4D重建和生成模型:目标一离开视野,物体持久性从九成掉到个位数,看见不等于记住。

这篇在解决什么

人看见滑板手骑出画面,仍能判断他大概还在往哪个方向滑、衣服没换成别人。现在的 4D 基础模型,无论是动态重建还是可控相机视频,评测几乎都停在像素级一致性和可见区域内的新视角。物体一出画,就没有对照,也就没有「还记不记得」这道题。

PersistBench 把 360 度视频当成全知记录:同一段全景可以裁出两条透视轨迹,输入轨迹里目标前半段可见、后半段离开视野,参考轨迹全程对着目标。模型只看输入,被要求生成参考视角。这样就有了出画之后的真值。

方法

视觉记忆拆成三个可分开打的分数。物体持久性:SAM2 能在生成帧里跟上目标,并且视觉语言模型确认还是同一个东西,按帧计成功比例。运动连续性:预测掩膜质心相对参考质心的尺度归一化距离,做成指数衰减分数,只在跟住的帧上算。外观保持:掩膜内 DINOv2 特征的余弦相似度。

数据来自公开的 360-1M。ViPE 估位姿,GeoCalib 把朝向对齐重力,VLM 发现物体,SAM3 在复制后的等距柱状图上跟踪,避免左右接缝把轨迹切断。相机轨迹用 B 样条加 L-BFGS,约束可见性和运动平滑。24,000 段原始全景筛完剩下 2,000 对,按人、车、动物、建筑、家具等十类,再分成静态和动态。

评了 12 个公开模型:重建侧 CUT3R、4DGT、CogNVS、NeoVerse;相机可控生成 ReCamMaster、TrajectoryCrafter、GEN3C、HyDRA;视频转 360 的 ViewPoint、Imagine360、Argus、CubeComposer。360 模型生成后再裁成透视,保证接口一致。

结果

所有模型在不可见段都明显掉分,可见段可以很高。

模型静态持久性 不可见(可见)动态持久性 不可见(可见)
CUT3R3.14% (66.43%)0.99% (43.99%)
4DGT16.03% (97.00%)3.89% (96.21%)
GEN3C83.97% (95.96%)87.06% (96.13%)
TrajectoryCrafter81.56% (99.55%)77.80% (99.74%)
Argus84.06% (99.25%)62.42% (98.97%)
Imagine36034.17% (98.24%)25.84% (98.14%)

显式把观测投影到目标视角再修补的模型,GEN3C、TrajectoryCrafter、NeoVerse,在不可见段更稳。CUT3R 这类隐式记忆几乎一出画就丢目标。运动连续性相对独立,和持久性、外观的相关只有 0.34 和 0.54;持久性和外观相关 0.93。静态分数和动态分数高度相关,静态做好的模型动态也不会差到没边。Argus 在静态上持久性和连续性最高,动态掉得也狠,和它训练数据里动态少、相机轨迹简单对得上。

为什么重要

4D 世界模型如果只在「目标一直看得见」的视频上训练,测新视角合成会显得很强,一出画就露馅。这篇把出画记忆从定性吐槽变成带真值的三项分数,后面做遮挡再出现、长时间动态的人可以按这张表对。训练建议也很具体:多造遮挡和再入画的数据,显式几何条件能把生成从凭空编降成修补。

局限与存疑

建数据和打分都依赖现成模型,ViPE 位姿、SAM2 跟踪、Qwen 判定都会把误差算进被测模型头上。作者说换组件排名大体还在,这只能说明不那么脆,不能说分数绝对干净。来源是 YouTube 360,场景分布跟着网红全景走,工业和夜间偏少。HyDRA 只预测出画之后的帧,可见段没有对照。运动连续性在多解轨迹上本身就有歧义,补充材料里有讨论。

术语

原文与代码

社区讨论

相关论文

全部论文解读