SPAR3S用稀疏体素自回归补全场景,两视角FID从180降到59

Sparse auto-regressive modeling for scene generation from multi-view images

Thomas Lucas, Maxime Pietrantoni, Philippe Weinzaepfel, Wonjune Cho, Bardienus Pieter Duisterhof, Vincent Leroy, Jerome Revaud

ECCV) 2026

cs.CV, cs.LG

2026-09-03

NAVER实验室的SPAR3S在稀疏体素潜空间里用掩码自回归同时预测占用和潜token,无需三维真值。两视角224×224上3DFront的FID从LatentSplat的180降到59。

这篇在解决什么

稀疏、无约束视角下补全整个 3D 场景,要猜没看见的几何和外观,还得算得起。前馈重建(DUSt3R、pixel-aligned 3DGS)只能覆盖输入图里看见的东西。把内容先在 2D 里用多视角扩散长出来再抬到 3D,又要先知道新相机,几何跨视角也不稳。直接在稠密体素里做生成,算力随分辨率三次方涨,大规模 3D 真值又少。

NAVER LABS Europe 的 SPAR3S 把问题收进稀疏、体素对齐的 3D 潜空间:只实例化被占用的体素,用可微 3D Gaussian Splatting 的光度监督学编码器-解码器,不需要 3D 真值。

方法

编码器吃任意数量的多视角图。先用点图(pointmap)把空体素滤掉,2D patch 与 3D 体素 token 做双向交叉注意力,注意力 logits 混入点图投影的几何引导。信息必须经过一份体素对齐的 3D 潜变量,再解码成每个占用体素上的一组 Gaussian。上采样时用二值占用头保持稀疏,训练时用真值占用并注入假阳性噪声。潜空间有轻度 KL 正则,主实验取潜维 32、每个占用体素 63 个 Gaussian。

生成器是掩码自回归 Transformer,同时预测占用和潜 token。占用用焦点损失;潜值用 token 级扩散头,而不是向量量化分类。训练时从稠密视角编码出不完整的目标潜变量,随机遮住一部分已观察位置,未知区域永远当预测目标但不进损失。推理按区域生长:以已观察体素为种子建 k-NN 图,BFS 分层向外扩,占用超过阈值才写入。还有粗到细两级占用,粗阶段高召回扫全图,细阶段只在候选体素上出潜向量。

结果

主表是两张条件图、基线很宽、分辨率 224×224 的新视角合成。3DFront 是一万多间合成室内;RealEstate10K 用 MASt3R-SfM 估计位姿和点图。

方法3DFront FIDPSNRSSIMRE10K FIDPSNR
PixelSplat1659.070.1815513.73
DepthSplat11013.760.498213.25
LatentSplat18013.920.335316.09
MVSplat3601119.720.356615.40
SPAR3S5915.180.624116.72

3DFront 上相对最强生成基线 LatentSplat,FID 从 180 降到 59,SSIM 从 0.33 到 0.62。条件图从 1 张加到 12 张,指标单调变好;占用阈值偏低更稳,漏掉墙和家具比多长一块更伤。消融:去掉扩散头 PSNR 15.18→13.90,去掉 3D RoPE→13.74,随机自回归顺序→14.81,不做占用精炼→14.48。若用真值占用解码,PSNR 到 17.90,占用错误仍是质量上限。

为什么重要

这条路线在 3D 里原生补全,不先采样新相机,也不靠 2D 扩散的多视图一致性碰运气。监督只有多视角图像,适合没有 3D 扫描的室内数据。现有数字停在 224×224 和室内场景,更接近「稀疏视角场景补全做不做得出去」的可行性,而不是可上线的新视角引擎。

局限与存疑

作者在附录写明:占用一旦漏掉墙或物体内部,场景会出现显眼的洞,这是当前最伤观感的因素;体素分辨率和每体素 Gaussian 密度还会带来局部发糊。他们把它看成缩放问题,并提到可用 2D 扩散做后处理,本文没做。主实验分辨率低,3DFront 用真值相机和渲染深度,RealEstate10K 轨迹平滑、重叠大,比宽基线室内难例更容易。编码器与生成器分开训,正文写单卡 A100 各约 4 天,附录给出编码器约一周、自回归 160 万步在 V100 上,复现预算要以附录为准。

术语

原文与代码

社区讨论

相关论文

全部论文解读