UniQuery4R:单次编码整段视频,查询式解码统一 4D 场景重建

zhenjun_zhao · x · 2026-08-19

arXiv 新论文(2608.17283,Tiancheng Chen 等)。动态 4D 场景重建需联合估计对应关系、几何、物体运动与相机运动;现有前馈方法要么预测稠密的任务特定图,要么独立处理源-目标帧对,导致稀疏查询下计算浪费、跨帧对特征复用受限。

UniQuery4R 采用查询条件化框架:多帧 clip 只编码一次,源视角、目标视角与连续源图像坐标仅在解码时通过源到目标交叉注意力选取;每个查询联合预测目标对应点、目标时刻 3D 位置、场景流及源深度,相机参数按视角估计。编码后的 clip 可在任意源-目标组合间复用,通过批量查询同时支持稀疏推理与稠密重建,且不依赖固定 clip 长度的时间嵌入。另提出场景流的方向-幅度参数化,对运动点与静止点分别监督。在 WorldTrack 上取得场景流估计与动态点重建的最佳宏平均成绩。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →