Uni4R:用最优传输加 ODE,让 4D 重建与追踪支持任意时刻查询

Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking

Liying Yang, Hao Mo, Jialun Liu, Chen Liu, Xinxing Yu, Chenhao Guan, Hui Ma, Xiao Cao, Ajian Liu, Yanyan Liang

cs.CV

2026-08-10

Uni4R 用最优传输+ODE 学出连续速度场,让 4D 重建与点追踪支持任意时刻查询;三大基准全 SOTA,80 帧推理 1.57 秒,比对手快 66%。

这篇在解决什么

4D 重建(逐帧的 3D 点图序列)和点追踪(同一批点在时间上的轨迹)通常被当成两个紧密相关的任务一起做。但现有方法几乎都只在整数帧上工作:输入第 0、1、2 帧,输出这些帧上的点和轨迹。如果想要第 0.7 帧的点,主流做法是事后插值,比如 TraceAnything 用 B-spline 把控制点连成曲线。

问题在于,B-spline 只是数学上的曲线拟合,不理解运动。它不知道物体的点应该沿着能量最低、几何连续的轨迹走,结果经常在分数时刻把结构扯变形:车轮变椭圆、窗户被拉伸。更糟的是,把运动建模当成纯拟合,丢掉了「重建给追踪提供几何约束、追踪给重建提供运动指引」这层本该双向受益的关系。

Uni4R 想把这两件事放进一个连续的运动学框架,让模型在任意时刻都能给出运动学上自洽的结果。

方法

核心是学一个连续的速度场(continuous velocity field)。把 4D 动力学写成一系列局部的常微分方程初值问题:第 k 帧到第 k+τ 帧之间任意一点的位置,等于从锚点 P(k) 出发沿速度场积分。

P(k+τ) = P(k) + ∫ V(P(t), t) dt

用「锚点」而不是从第 0 帧一路积分到底,是为了避免误差越积越大。每个整数帧都是一个新锚点,误差不跨帧累积。

但这里有个真困难:只有整数帧上的观测(点图)当监督,要反推一个连续速度场,是高度病态的逆问题。无穷多条弯曲的速度场都能让点在第 k 帧和第 k+1 帧之间对得上,模型会过拟合、轨迹不稳。Uni4R 的解法是塞进一个运动学归纳偏置,把解空间约束到「最运动学自洽」的那条。

这个偏置来自最优传输(Optimal Transport)。借鉴 Flow Matching 理论:两个状态之间最优传输对应的概率路径是直线,对应最小动能。Uni4R 在锚点特征流形上构造这条 OT 直线,作为全局速度方向先验。具体在 Flow Matching Guided Decoder(FMGD)里:全局速度分支抽锚点特征 X,点重建分支抽几何特征 FR,再用凸组合构造 OT 路径上的 FM 引导速度特征。一个局部速度预测模块(LVP)把这几路特征加上连续时间嵌入,经时空交叉注意力解出任意时刻的速度,最后用一阶 Euler ODE 求解器积分得到点位置。

训练还有个坎:分数时刻没有真实速度做监督。他们提出积分一致性训练策略(integral-consistency training),把预测速度从整数帧 T 积分到 T+1,用 T+1 的真实点图来监督。梯度沿着积分路径回传到上游解码器,等于把「看不见的速度」翻译成「能监督的点图」。

结果

三个维度都拿了 SOTA。

任务指标Uni4R最强对手
世界坐标 3D 点追踪(Point Odyssey)APD3D↑81.59V-DPM 81.27
世界坐标 3D 点追踪(Aerial Digital Twin)APD3D↑86.55V-DPM 85.72
4D 重建(Point Odyssey)APD↑ / EPE↓80.71 / 0.222St4RTrack 78.73 / 0.241
连续时间运动学一致性MAM↓7.272TraceAnything 7.891

在点追踪上,Uni4R 在四个测试集(PO/DR/ADT/PStudio)的 APD3D 全部最高,小幅领先 V-DPM,把 St4RTrack 和 TraceAnything 拉开十几个点。4D 重建同样全场最好。最能说明问题的是他们新建的连续时间运动学基准(100 个动态场景,每个 24 整数帧加 230 个分数帧,带密集真值):Uni4R 在时间平滑性(MAM)、空间拓扑稳定性(ELV、VLPD)和精度(APD)上全部最优,证实轨迹在分数时刻确实保持了几何结构,而不是像基线那样把车轮算成椭圆。

效率上,80 帧输入在单张 H800 上 1.57 秒,比 TraceAnything 快 66.52%,仅次于 St4RTrack(1.34 秒)但精度高得多;而 V-DPM 要 194 秒。

消融也讲得清楚:去掉 flow matching 损失、去掉 FM 速度特征、去掉积分一致性训练、去掉 LVP,每一项都让性能掉;把锚点 ODE 换成从第 0 帧积分到底的全局 ODE,误差累积立刻拖低所有任务。只训速度分支或只训重建分支都比联合训练差,印证了「重建与追踪互为约束」的设计意图。

为什么重要

对做动态场景理解的人(机器人、AR/VR、视频特效、自动驾驶里的运动估计),这篇把「分数时刻该长什么样」从一个拍脑袋的插值问题,变成了一个有运动学约束的可学问题。需要任意时刻稠密对应关系时,不用再忍受 B-spline 的几何扭曲。

更值得借鉴的是方法论本身:把一个病态的连续逆问题,用最优传输的「直线路径等于最小动能」当先验来正则化。这个思路不限于 4D,任何要从离散观测反推连续场的任务都可能套用。

局限与存疑

论文没有写专门的局限小节,这本身是个问题。几个值得追问的点:模型只吃单目(monocular)输入,深度先验天然受限;训练只用 Point Odyssey、Dynamic Replica、Kubric 三个数据集(前两个偏合成),真实复杂场景的泛化没充分验证;连续时间运动学基准是作者自己提的,指标和场景都由他们定义,缺乏独立第三方的对照。另外 43.67GB 的显存比 TraceAnything(35.71GB)和 St4RTrack(24GB)都高,部署门槛不低;和 V-DPM 比虽然快了两个数量级,但 V-DPM 精度也不差,工程选型要看具体的精度与速度权衡。

术语

原文与代码

社区讨论

相关论文

全部论文解读