NVIDIA 用点云锚点统一 3D 补全与编辑,遮挡场景 F-score 达 0.90

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

Anita Hu, Maria Shugrina

ECCV 2026

cs.CV

2026-07-23

Axolotl3D 把遮挡补全、多视角重建、几何编辑统一成一种「受约束补全」,用部分点云做几何锚点加相机对齐,在 Toys4K 和 OmniObject3D 上刷新 SOTA。

这篇在解决什么

从一张图生成 3D 模型这件事,Hunyuan3D 2.1、Trellis 这类扩散模型已经做得很好。但它们有个共同前提:输入是一张完整的、没有被挡住的图。真实世界几乎不成立。拍一个物件,常常是稀疏的多视角、有遮挡,或者要在已有网格上做几何感知的编辑。Amodal3R 专攻被遮挡几何的恢复,ReconViaGen 强调跨视角一致性,Instant3dit、PrEditor3D 做编辑。这些方案各管一段,合不到一起。

Axolotl3D 的判断是:这几件事其实是同一个问题。不管是补全被挡住的部分、拼多张视角,还是在已有形状上改一块,都归结为「从不完整的观测里,在几何约束下补出一个完整且自洽的 3D 物体」。把这个共性抽出来,就能用一个框架统一处理。

方法

模型建在 Hunyuan3D 2.1 之上。原版的形状生成部分是一个形状自编码器 ShapeVAE,加一个图像条件的基于流的扩散 transformer(DiT)。Axolotl3D 把 DiT 原来只看单张图的交叉注意力换成多模态交叉注意力,让它同时吃进四类输入:最多 6 张图、每张图的可见性遮罩、相机参数,以及一个部分点云。

四个输入各有分工。DINOv2 编码图像特征;相机参数用 Plücker 嵌入表示,把每个像素对应的相机光线方向编码进去,加到图像特征上,多视角才能对齐到一个共享的三维坐标系。可见性遮罩把每张图切成 14×14 的 patch,完全没被挡的标 1,被挡的标 0,背景也被当成「没被挡」以施加自由空间约束。点云是几何锚点,用 VecSetX 编码成定长 latent,逼模型忠实于已知区域的几何。

融合阶段,每个模态走自己的门控 FFN 映射到统一的 1024 维通道,再加可学习的模态标识区分视觉和几何 token。决定性的一步是掩码偏置的交叉注意力:被遮挡的视觉 token 的注意力偏置设为负无穷,直接不参与,未遮挡的设为 0,点云 token 不加掩蔽。模型只能从不被挡的地方取证据。

训练靠合成数据增广,从 407k 个网格(TRELLIS-500K)采样,按等概率模拟四种场景:稀疏视角加遮挡、大面积点云丢弃、编辑、干净的单/多视角。这套增广是把补全和编辑塞进同一个模型的直接手段。模型从 Hunyuan3D 2.1 预训练权重微调,8 张 A100 上跑 50 万步。

结果

作者在 Toys4K(4k 合成物体)和 OmniObject3D(6k 扫描物体)上评测,分单视角和多视角、有遮挡和无遮挡。单视角带遮挡最吃力,Axolotl3D 拉开的差距也最大:

方法F-score↑vIoU↑CD↓×10
Amodal3R0.68770.18860.6144
ShapeR(并发工作)0.74530.22850.4622
Axolotl3D0.90460.32650.2402

换成 6 视角带遮挡,F-score 提升到 0.9689,并发工作 ShapeR 是 0.9190,Hy3D-Omni 是 0.8920。所有设置下 Axolotl3D 的标准差都更低,输出更稳定。

鲁棒性上,用单目预测深度代替真值点云(无遮挡)时,F-score 仍有 0.7616,高于 SAM3D 的 0.7062 和 ShapeR 的 0.5626。再加 10° 旋转、10% 平移、±5% 焦距的相机扰动,F-score 从 0.7616 变到 0.7620,几乎不动。作者把这归功于 Plücker 相机嵌入。

消融实验最能说明设计取舍。去掉点云条件,F-score 从 0.9036 掉到 0.8074,是最大的一档跌幅,点云锚点是忠实补全的关键。去掉可见性掩蔽,数值只小幅下降,视觉差异几乎看不出来,它更多是个防干扰的保险。去掉显式相机参数,多视角下指标几乎不变(模型能从视觉线索反推相对相机位姿),但单视角退化更明显,没了相机信息,3D 点和图像特征对不齐。

为什么重要

对做 3D 重建和内容创作的人,意义在于不用再为遮挡补全、多视角重建、编辑分别找一套方案,一个模型、一套权重都能接。点云锚点让它在已知区域上忠于输入,从扫描数据或单目深度估计接进来的几何信息能被直接利用,而不是被生成先验覆盖。论文还演示了两条落地路径:用 MapAnything 从单图估出点云和相机再做生成;用图像修复(Stable Diffusion Inpainting)改一张视角、保留未编辑区域的点云,做几何一致的编辑。这些不是评测数字,但说明它在真实管线里可接。

要泼一盆冷水:这一切的前提是输入的点云和相机参数本身比较干净。作者也承认这是未来工作。

局限与存疑

作者在附录里列得相当坦诚。相机用固定距离和内参训练,要求物体完整出现在画面里,换到野生相机视角鲁棒性会打折。极细结构有时连不起来,精细表面细节会被抹平或变厚。模型被训练成忠实跟随输入点,没显式学过应对噪声,深度不连续处的伪影、Gaussian splat 的离群点、SfM 的稀疏锐边都会让它难受。点云固定下采样到 8192 个点(最远点采样),没针对极稀疏或锐边点训练。它只生成形状,不预测纹理。

另有一处存疑:与并发工作 ShapeR 的对比里,多视角下两者其实接近(0.9689 vs 0.9190),Axolotl3D 的主要优势在单视角和稳定性。如果应用场景就是规整的多视角重建,统一的收益需要再掂量。

术语

原文与代码

社区讨论

相关论文

全部论文解读