成均馆大学给3DGS-SLAM加预测不确定性,关键帧约砍七成

BayesianGS-SLAM: Uncertainty-Aware Neural Rendering SLAM via Probabilistic Formulation

Kyeongsu Kang, Seongbo Ha, Sibaek Lee, Hyeonwoo Yu

cs.RO

2026-09-21

成均馆大学把传感器噪声和透明度引起的地图不确定性合成RGB-D预测方差,同时用于建图、跟踪残差归一化和关键帧挑选。TUM平均ATE 3.12厘米,关键帧大约少70%。

这篇在解决什么

神经渲染 SLAM 用渲染出来的 RGB-D 残差做跟踪和建图。残差可不可信,会随传感器噪声、观测覆盖和地图空洞大变。没有可靠性估计时,差残差会把位姿拉歪,已经被地图解释好的帧仍会触发一次建图。

经典 SLAM 本来就是贝叶斯的。神经渲染这边要么只在建图里用不确定性,要么只建模颜色(VarSplat),要么上采样、多网络,在线跑不动。成均馆大学要的是一份对颜色和深度都成立、又能贯穿建图-跟踪-关键帧的预测不确定性。

方法

骨干是 LoopSplat 的 RGB-D 3DGS SLAM。不确定性拆成两块:传感器噪声由一个小 MLP/CNN 从当前 RGB-D 预测;地图表示不确定性放在高斯透明度上,因为透明度决定可见性和前到后合成权重,颜色和深度都受它影响。

渲染非线性,解析传播本来做不到。论文把 alpha compositing 对透明度做一阶展开,得到渲染方差:沿射线把 (ci − 渲染颜色)² Ti² σα² 累加,深度同理。预测方差是传感器项加这项。建图损失在常规 3DGS 损失之外,对颜色和深度加高斯负对数似然:残差除以预测方差,再加上 log 方差,防止网络把不确定性喊到无穷。

跟踪阶段冻结高斯和不确定性网络。完整 NLL 加 log 项在线不稳定,实际用的是不确定性归一化的 L1:残差除以标准差。关键帧用同一份预测分布的负对数似然当 predictive surprise,超过阈值就插入,另外每 N=5 帧保底插一帧。实现里阈值 K=0。

结果

TUM 和 ScanNet,RTX 4090。

方法TUM ATE (cm)ScanNet ATE (cm)Depth AUSE
LoopSplat3.337.7未报
VarSplat3.206.50.2752
CG-SLAM4.08.10.1842
BayesianGS3.126.70.1060

TUM 平均 ATE 3.12 cm,表上最低。ScanNet 6.7 cm,略高于 VarSplat 的 6.5,三次重复的波动更小。颜色 AUSE 0.0121,和 VarSplat 的 0.0123 持平;深度 AUSE 从 CG-SLAM 的 0.1842、VarSplat 的 0.2752 降到 0.1060。渲染在训练关键帧上评,TUM PSNR 23.30,略高于 LoopSplat 22.72 和 VarSplat 23.14,这不是新视角对比。

关键帧:fr1/desk 从每帧 591 降到 137,fr2/xyz 3393 到 744,fr3/office 2514 到 545,大约 70%。FPS 0.56,快过带不确定性的 VarSplat(0.47),慢过不算不确定性的 LoopSplat(0.59)。

跟踪目标消融:普通 L1 在 fr1/room 失败;完整高斯 NLL 平均 ATE 42.44 cm;带 log 项 49.68 cm;归一化 L1 平均 4.18 cm,五条都跟上。打开跟踪和关键帧模块后,TUM ATE 从 3.47 到 3.12,关键帧从 1689.8 到 380.6。

为什么重要

不确定性如果只躺在建图损失里,对 SLAM 几乎没帮助。这篇让同一张预测方差同时降权不可靠像素、少建已经解释好的帧。深度 AUSE 的提升说明透明度扰动对几何更关键,只学颜色方差不够。手持和车载 RGB-D 有定性建图结果,至少说明能离开基准数据集。

跟踪精度是渐进的,TUM 只比 VarSplat 好 0.08 cm。真正能省的是建图次数。

局限与存疑

渲染质量在训练关键帧上评,不能当新视角 SOTA。ScanNet ATE 没有超过 VarSplat。K=0 意味着任何正 surprise 都可能插入,实际筛选力度有多大,论文没把阈值曲线画全。少建图会推迟地图 refinement,准则漏掉信息帧时会滞后。一阶线性化加高斯假设在强遮挡、强非线性处可能不准。FPS 仍低于 1,还不是机载实时。手持/车载只有定性图。

术语

原文与代码

社区讨论

相关论文

全部论文解读