Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking
Liying Yang, Hao Mo, Jialun Liu, Chen Liu, Xinxing Yu, Chenhao Guan, Hui Ma, Xiao Cao, Ajian Liu, Yanyan Liang
cs.CV
2026-08-10
Uni4R 用最优传输+ODE 学出连续速度场,让 4D 重建与点追踪支持任意时刻查询;三大基准全 SOTA,80 帧推理 1.57 秒,比对手快 66%。
4D 重建(逐帧的 3D 点图序列)和点追踪(同一批点在时间上的轨迹)通常被当成两个紧密相关的任务一起做。但现有方法几乎都只在整数帧上工作:输入第 0、1、2 帧,输出这些帧上的点和轨迹。如果想要第 0.7 帧的点,主流做法是事后插值,比如 TraceAnything 用 B-spline 把控制点连成曲线。
问题在于,B-spline 只是数学上的曲线拟合,不理解运动。它不知道物体的点应该沿着能量最低、几何连续的轨迹走,结果经常在分数时刻把结构扯变形:车轮变椭圆、窗户被拉伸。更糟的是,把运动建模当成纯拟合,丢掉了「重建给追踪提供几何约束、追踪给重建提供运动指引」这层本该双向受益的关系。
Uni4R 想把这两件事放进一个连续的运动学框架,让模型在任意时刻都能给出运动学上自洽的结果。
核心是学一个连续的速度场(continuous velocity field)。把 4D 动力学写成一系列局部的常微分方程初值问题:第 k 帧到第 k+τ 帧之间任意一点的位置,等于从锚点 P(k) 出发沿速度场积分。
P(k+τ) = P(k) + ∫ V(P(t), t) dt
用「锚点」而不是从第 0 帧一路积分到底,是为了避免误差越积越大。每个整数帧都是一个新锚点,误差不跨帧累积。
但这里有个真困难:只有整数帧上的观测(点图)当监督,要反推一个连续速度场,是高度病态的逆问题。无穷多条弯曲的速度场都能让点在第 k 帧和第 k+1 帧之间对得上,模型会过拟合、轨迹不稳。Uni4R 的解法是塞进一个运动学归纳偏置,把解空间约束到「最运动学自洽」的那条。
这个偏置来自最优传输(Optimal Transport)。借鉴 Flow Matching 理论:两个状态之间最优传输对应的概率路径是直线,对应最小动能。Uni4R 在锚点特征流形上构造这条 OT 直线,作为全局速度方向先验。具体在 Flow Matching Guided Decoder(FMGD)里:全局速度分支抽锚点特征 X,点重建分支抽几何特征 FR,再用凸组合构造 OT 路径上的 FM 引导速度特征。一个局部速度预测模块(LVP)把这几路特征加上连续时间嵌入,经时空交叉注意力解出任意时刻的速度,最后用一阶 Euler ODE 求解器积分得到点位置。
训练还有个坎:分数时刻没有真实速度做监督。他们提出积分一致性训练策略(integral-consistency training),把预测速度从整数帧 T 积分到 T+1,用 T+1 的真实点图来监督。梯度沿着积分路径回传到上游解码器,等于把「看不见的速度」翻译成「能监督的点图」。
三个维度都拿了 SOTA。
| 任务 | 指标 | Uni4R | 最强对手 |
| 世界坐标 3D 点追踪(Point Odyssey) | APD3D↑ | 81.59 | V-DPM 81.27 |
| 世界坐标 3D 点追踪(Aerial Digital Twin) | APD3D↑ | 86.55 | V-DPM 85.72 |
| 4D 重建(Point Odyssey) | APD↑ / EPE↓ | 80.71 / 0.222 | St4RTrack 78.73 / 0.241 |
| 连续时间运动学一致性 | MAM↓ | 7.272 | TraceAnything 7.891 |
在点追踪上,Uni4R 在四个测试集(PO/DR/ADT/PStudio)的 APD3D 全部最高,小幅领先 V-DPM,把 St4RTrack 和 TraceAnything 拉开十几个点。4D 重建同样全场最好。最能说明问题的是他们新建的连续时间运动学基准(100 个动态场景,每个 24 整数帧加 230 个分数帧,带密集真值):Uni4R 在时间平滑性(MAM)、空间拓扑稳定性(ELV、VLPD)和精度(APD)上全部最优,证实轨迹在分数时刻确实保持了几何结构,而不是像基线那样把车轮算成椭圆。
效率上,80 帧输入在单张 H800 上 1.57 秒,比 TraceAnything 快 66.52%,仅次于 St4RTrack(1.34 秒)但精度高得多;而 V-DPM 要 194 秒。
消融也讲得清楚:去掉 flow matching 损失、去掉 FM 速度特征、去掉积分一致性训练、去掉 LVP,每一项都让性能掉;把锚点 ODE 换成从第 0 帧积分到底的全局 ODE,误差累积立刻拖低所有任务。只训速度分支或只训重建分支都比联合训练差,印证了「重建与追踪互为约束」的设计意图。
对做动态场景理解的人(机器人、AR/VR、视频特效、自动驾驶里的运动估计),这篇把「分数时刻该长什么样」从一个拍脑袋的插值问题,变成了一个有运动学约束的可学问题。需要任意时刻稠密对应关系时,不用再忍受 B-spline 的几何扭曲。
更值得借鉴的是方法论本身:把一个病态的连续逆问题,用最优传输的「直线路径等于最小动能」当先验来正则化。这个思路不限于 4D,任何要从离散观测反推连续场的任务都可能套用。
论文没有写专门的局限小节,这本身是个问题。几个值得追问的点:模型只吃单目(monocular)输入,深度先验天然受限;训练只用 Point Odyssey、Dynamic Replica、Kubric 三个数据集(前两个偏合成),真实复杂场景的泛化没充分验证;连续时间运动学基准是作者自己提的,指标和场景都由他们定义,缺乏独立第三方的对照。另外 43.67GB 的显存比 TraceAnything(35.71GB)和 St4RTrack(24GB)都高,部署门槛不低;和 V-DPM 比虽然快了两个数量级,但 V-DPM 精度也不差,工程选型要看具体的精度与速度权衡。