南邮挂名Depth Anything V4,投稿两日因重大错误撤回

Depth Anything V4: Dynamic 4D Scene Reconstruction via Riemannian Flow Matching on 4D Gaussian Splatting

Jiaming Fan, Jian Lu, Jinling Jia, Chenbin Zhang

cs.CV

2026-08-19

南邮团队用黎曼流匹配生成4D高斯,声称相对MLP的F1高出0.044;作者两日以「重大研究错误」撤回,主表数字互相矛盾。

这篇在解决什么

Depth Anything 系列把单目深度做成了可直接调用的前馈模型:V1 吃无标注数据,V2 用合成数据提边界,V3 加多视图几何。三条线都是判别式回归,一帧出一个点估计,没有时间,也没有体积场。

南京邮电大学这组人把续作直接命名为 Depth Anything V4,任务却换成了另一件事:从单目视频重建动态 4D 场景。表征跟 4D Gaussian Splatting 走,每个高斯的尺度、旋转、不透明度落在非欧流形上。欧氏空间里对参数做线性插值,中间态会出现负尺度、非单位四元数,只能事后裁剪或投影。他们要处理的就是这条非法路径。

这份 PDF 在 2026 年 8 月 18 日挂上 arXiv,8 月 20 日被第一作者 Jiaming Fan 撤回,备注是 Major errors in research。下面按正文把主张讲清楚,再拿表对表。

方法

主干是冻住的 DINOv2-L,后面接 Perceiver,把可变数量的高斯压成 512 个 token。先验是 Riemannian Flow Matching:在流形测地线上定义从噪声到目标高斯的概率路径,学一个同时吃图像特征和视频时刻 τ 的向量场,用 ODE 从噪声积出一组高斯,数量定在 10 万。

流形操作按参数拆开:

教师网络是一个 4DGS Head。损失里有渲染光度、带刚性分数的 SE(3) 等变、RAFT 光流一致性,外加用 Depth Anything V2 的中值深度做尺度正则。正文反复写训练损失不用人工深度标注,同时又把 DA2 深度写成弱监督。

推理分两段 ODE:粗 10 步铺全局,细 20 步加细节。细阶段可以把渲染损失的梯度加进向量场,再做 20 步、学习率 \(10^{-3}\) 的 test-time optimization(TTO,推理时用渲染误差把样本往当前视频上贴)。对照用的确定性 MLP 共用同一套 WebVid-10M + MegaDepth 数据、同一骨架和同一套 TTO,只把目标从流匹配换成 L2 回归。预训练写成 360 GPU 小时。

结果

主表把三个因素拆开,评测写在 Dynamic-Sim(自称 100 个带 4DGS 真值的合成场景)和 KITTI Dynamic(50 段)上:

方法Dynamic-Sim F1KITTI F1
4D-GS 100 iter0.7020.552
4D-GS + TTO0.7480.598
MLP + TTO0.7620.615
RFM + TTO0.8060.652

分解写成:TTO 贡献 +0.046,预训练 +0.014,RFM 相对同条件 MLP 再 +0.044。KITTI 上 RFM 的隔离增益写成 +0.037。完整优化的 4D-GS(5000 步)F1 是 0.781 / 0.623,低于 DAV4 的 20 步 TTO。

新视角合成、同一套 20 步 TTO 预算下,ETH3D 上 DAV4 的 PSNR 是 25.13 dB,随机初始化的 3D-GS 20 步是 22.34 dB,3D-GS 跑满 5000 步是 24.12 dB。ScanNet 上对应数字是 23.82 / 21.58 / 23.05 dB。不确定性用 10 条独立 ODE 的方差来估,NGLL -1.58、ECE 0.058,对照 MC-Dropout 的 -0.82 / 0.18。欧氏流匹配加事后投影的 F1 是 0.684,无效高斯 12.3%;黎曼版本写成 0.806 和 0.01%。单场景推理 420 ms,对比文中 DA3 的 38 ms。

这些数字不能直接当结论用。

为什么重要

对要跟进的人,结论先说清楚:不要把这篇当可复现基线,也不要当 Depth Anything 官方续作。作者单位是南京邮电大学人工智能学院和自动化学院,和 Depth Anything 原系列(Yang 等人)不是同一组人。任务从单目深度估计换成了离线 4D 重建,拿 420 ms 去比 DA3 的 38 ms,比的不是同一类产品。

在流形上做 flow matching、避免非法高斯中间态,这个方向本身说得通,4DGS 的尺度和旋转确实不在欧氏空间里。但这份实现、数据和对照已经从公开记录里撤掉了。想做同类事,应回到 4D-GS、Deformable-GS 和 Riemannian flow matching 的原始文献,而不是这份挂名续作。

局限与存疑

作者自己列了四条:420 ms 推理上不了实时;预训练 360 GPU 小时不便宜;新视角对照里 3D-GS 是随机初始化、DAV4 是预训练初始化;渲染梯度不是保守场,TTO 引导没有能量解释。

比自述更硬的问题在表里。

时间消融表写的评测集是 KITTI Dynamic:去掉 τ 后 F1 0.742,加上 τ 后 F1 0.806。主表里 0.806 是 Dynamic-Sim 上 RFM+TTO 的分数,KITTI 上同一模型是 0.652。KITTI 消融直接套用了另一张表的合成数据分数。

算力表同样对不上。正文公式写成 \(420 + 360 \times 3600 / 1000 = 1716\) 毫秒/场景(N=1000),这是把 GPU 秒和毫秒加在一起。附录按毫秒摊销,N=10,000 时是 \(1.296 \times 10^5\) 毫秒;主文同一栏写成 550 毫秒。两张自称「已校正」的成本表无法同时成立。

「不用人工深度标注」和「用 DA2 中值深度做尺度」写在同一段。参考文献把 Neural Scene Flow Fields 写成 Wang 等人 2021,这条工作通行署名是 Li 等人。Dynamic-Sim 被当作 ICCV 2023 数据集引用,并带 4DGS 真值;4DGS 方法本身是 2024 年才发表的,时间线对不上。v1 摘要已经出现 corrected computational cost analysis,像一稿里残留的修改痕迹。

8 月 20 日的撤回注释是 Major errors in research。就正文能核对的部分,主主张「RFM 隔离贡献 +0.044」已经无法从自洽的表格里读出来。

术语

原文与代码

社区讨论

相关论文

全部论文解读