Sparse auto-regressive modeling for scene generation from multi-view images
Thomas Lucas, Maxime Pietrantoni, Philippe Weinzaepfel, Wonjune Cho, Bardienus Pieter Duisterhof, Vincent Leroy, Jerome Revaud
ECCV) 2026
cs.CV, cs.LG
2026-09-03
NAVER实验室的SPAR3S在稀疏体素潜空间里用掩码自回归同时预测占用和潜token,无需三维真值。两视角224×224上3DFront的FID从LatentSplat的180降到59。
稀疏、无约束视角下补全整个 3D 场景,要猜没看见的几何和外观,还得算得起。前馈重建(DUSt3R、pixel-aligned 3DGS)只能覆盖输入图里看见的东西。把内容先在 2D 里用多视角扩散长出来再抬到 3D,又要先知道新相机,几何跨视角也不稳。直接在稠密体素里做生成,算力随分辨率三次方涨,大规模 3D 真值又少。
NAVER LABS Europe 的 SPAR3S 把问题收进稀疏、体素对齐的 3D 潜空间:只实例化被占用的体素,用可微 3D Gaussian Splatting 的光度监督学编码器-解码器,不需要 3D 真值。
编码器吃任意数量的多视角图。先用点图(pointmap)把空体素滤掉,2D patch 与 3D 体素 token 做双向交叉注意力,注意力 logits 混入点图投影的几何引导。信息必须经过一份体素对齐的 3D 潜变量,再解码成每个占用体素上的一组 Gaussian。上采样时用二值占用头保持稀疏,训练时用真值占用并注入假阳性噪声。潜空间有轻度 KL 正则,主实验取潜维 32、每个占用体素 63 个 Gaussian。
生成器是掩码自回归 Transformer,同时预测占用和潜 token。占用用焦点损失;潜值用 token 级扩散头,而不是向量量化分类。训练时从稠密视角编码出不完整的目标潜变量,随机遮住一部分已观察位置,未知区域永远当预测目标但不进损失。推理按区域生长:以已观察体素为种子建 k-NN 图,BFS 分层向外扩,占用超过阈值才写入。还有粗到细两级占用,粗阶段高召回扫全图,细阶段只在候选体素上出潜向量。
主表是两张条件图、基线很宽、分辨率 224×224 的新视角合成。3DFront 是一万多间合成室内;RealEstate10K 用 MASt3R-SfM 估计位姿和点图。
| 方法 | 3DFront FID | PSNR | SSIM | RE10K FID | PSNR |
| PixelSplat | 165 | 9.07 | 0.18 | 155 | 13.73 |
| DepthSplat | 110 | 13.76 | 0.49 | 82 | 13.25 |
| LatentSplat | 180 | 13.92 | 0.33 | 53 | 16.09 |
| MVSplat360 | 111 | 9.72 | 0.35 | 66 | 15.40 |
| SPAR3S | 59 | 15.18 | 0.62 | 41 | 16.72 |
3DFront 上相对最强生成基线 LatentSplat,FID 从 180 降到 59,SSIM 从 0.33 到 0.62。条件图从 1 张加到 12 张,指标单调变好;占用阈值偏低更稳,漏掉墙和家具比多长一块更伤。消融:去掉扩散头 PSNR 15.18→13.90,去掉 3D RoPE→13.74,随机自回归顺序→14.81,不做占用精炼→14.48。若用真值占用解码,PSNR 到 17.90,占用错误仍是质量上限。
这条路线在 3D 里原生补全,不先采样新相机,也不靠 2D 扩散的多视图一致性碰运气。监督只有多视角图像,适合没有 3D 扫描的室内数据。现有数字停在 224×224 和室内场景,更接近「稀疏视角场景补全做不做得出去」的可行性,而不是可上线的新视角引擎。
作者在附录写明:占用一旦漏掉墙或物体内部,场景会出现显眼的洞,这是当前最伤观感的因素;体素分辨率和每体素 Gaussian 密度还会带来局部发糊。他们把它看成缩放问题,并提到可用 2D 扩散做后处理,本文没做。主实验分辨率低,3DFront 用真值相机和渲染深度,RealEstate10K 轨迹平滑、重叠大,比宽基线室内难例更容易。编码器与生成器分开训,正文写单卡 A100 各约 4 天,附录给出编码器约一周、自回归 160 万步在 V100 上,复现预算要以附录为准。