NVIDIA GATOR:生成加 agent,杂乱照片重建可仿真 3D 物体

GATOR: Generative and Agentic 3D Object Reconstruction From Casual Images

Qirui Wu, Stan Birchfield, Hesam Rabeti, Angel X. Chang, Bowen Wen

cs.CV, cs.RO

2026-10-08

NVIDIA 的 GATOR 用生成模型打底、GPT-6 agent 修补,从杂乱随手照片重建带位姿的完整 3D 物体,真实桌面数据倒角距离约为 Pixal3D 一半。

这篇在解决什么

把随手拍的照片变成能用的 3D 资产:完整几何、带纹理,还要有物体在场景里的位姿,能放回原场景做仿真或编辑。casual 图像难在具体处:目标埋在桌面杂物或房间角落里,被遮挡,只从几个不规则视角拍到,背面完全看不见,相机、深度、mask 全靠估。

现有两条路各卡一半。生成式重建(LRM、TRELLIS.2、SAM 3D)靠先验补看不见的背面,补得视觉上过得去,和真实物体可能差很远;图像、mask、几何各自独立编码喂进模型,对应关系要靠去噪器自己猜。纯 agent 路线让 GPT-6-Astra 写 Blender 脚本,结构和材质可控,但从零造资产要反复调 API、渲染,又慢又贵,细粒度几何也撑不住:图 1 里滤网碗被生成模型填得不准,agent 则把把手和提耳简化成粗糙形状。GATOR 把两条路接起来,生成模型先出完整、场景对齐的草稿,agent 在这个底子上做定点修补。

方法

生成段建在 TRELLIS.2 的「结构、几何、外观」三段级联上:

agent 段把生成资产、输入图像和 Blender 交给 GPT-6-Astra(Codex 命令行、extra-high 推理档)。它自己决定修什么:补缺失结构、修拓扑、改 UV 和材质,含文字 logo 的清晰度;每次编辑后在匹配相机和光照下对比编辑前后渲染,变差就回滚,预算内选最优。主实验每物体 10 分钟,生成模型全程不重训。

结果

基准指标GATOR最强基线
Toys4K,4 视图CD / F10.009 / 0.757Pixal3D-MV 0.011 / 0.701
真实桌面(LM-O+HB+HANDAL)CD / F1 / LPIPS0.009 / 0.904 / 0.140Pixal3D CD 0.018,MV-SAM3D F1 0.780
ScanNet++,229 物体、49 场景CD / F10.031 / 0.603RecGen 0.041 / 0.540
位姿,未对齐直接测[email protected]HANDAL 96.36%,ScanNet++ 95.63%ScanNet++ 次优 90.83%

ScanNet++ 上相机、深度、mask 全是估计值(mask 来自 SAM3),GATOR 的 CD 比次优 RecGen 低 23%,且全部指标超过从零建模的 GPT-6-Astra。消融在 55 个 HANDAL 物体上逐个加组件:modality mixer 主要把 ADD-SB 从 0.057 降到 0.037,提升的是对估计误差的鲁棒性;文本条件九项全涨(F1 0.872 到 0.930);agent 精化主要涨外观(PSNR 18.93 到 19.60)。

效率数字最直观:纯生成约 0.5 分钟(生成计算约 32 秒),已优于拿 20 分钟预算的 GPT-6-Astra;后者 1 分钟预算下 10 个物体 0 个产出有效资产,2 分钟 5 个,5 分钟起才全部有效。只看两个视角的 GATOR,CD 约为用八个视角的 Pixal3D 的一半。

为什么重要

做机器人仿真、场景重建、数字资产的人,casual 照片直接产出带 PBR 材质、带场景位姿的可仿真物体,不再需要孤立拍摄和标定。四个真实数据集零微调泛化,靠的是合成数据加误差注入的配方,这个配方本身可以搬走。

方法论上,这是个干净的「生成打底、agent 修补」案例:agent 不从零建模,在实例级几何和位姿上做局部编辑,时间可控、可回滚、不动生成模型权重,对其他 3D 生成任务应该可迁移。也说实话:干净合成数据上对最强基线的提升是渐进的(Toys4K CD 降 19.7%),真正拉开差距的是杂乱真实场景(桌面 CD 减半)和位姿恢复,后者不少基线根本不输出。

局限与存疑

术语

原文与代码

社区讨论

相关论文

全部论文解读