BayesianGS-SLAM: Uncertainty-Aware Neural Rendering SLAM via Probabilistic Formulation
Kyeongsu Kang, Seongbo Ha, Sibaek Lee, Hyeonwoo Yu
cs.RO
2026-09-21
成均馆大学把传感器噪声和透明度引起的地图不确定性合成RGB-D预测方差,同时用于建图、跟踪残差归一化和关键帧挑选。TUM平均ATE 3.12厘米,关键帧大约少70%。
神经渲染 SLAM 用渲染出来的 RGB-D 残差做跟踪和建图。残差可不可信,会随传感器噪声、观测覆盖和地图空洞大变。没有可靠性估计时,差残差会把位姿拉歪,已经被地图解释好的帧仍会触发一次建图。
经典 SLAM 本来就是贝叶斯的。神经渲染这边要么只在建图里用不确定性,要么只建模颜色(VarSplat),要么上采样、多网络,在线跑不动。成均馆大学要的是一份对颜色和深度都成立、又能贯穿建图-跟踪-关键帧的预测不确定性。
骨干是 LoopSplat 的 RGB-D 3DGS SLAM。不确定性拆成两块:传感器噪声由一个小 MLP/CNN 从当前 RGB-D 预测;地图表示不确定性放在高斯透明度上,因为透明度决定可见性和前到后合成权重,颜色和深度都受它影响。
渲染非线性,解析传播本来做不到。论文把 alpha compositing 对透明度做一阶展开,得到渲染方差:沿射线把 (ci − 渲染颜色)² Ti² σα² 累加,深度同理。预测方差是传感器项加这项。建图损失在常规 3DGS 损失之外,对颜色和深度加高斯负对数似然:残差除以预测方差,再加上 log 方差,防止网络把不确定性喊到无穷。
跟踪阶段冻结高斯和不确定性网络。完整 NLL 加 log 项在线不稳定,实际用的是不确定性归一化的 L1:残差除以标准差。关键帧用同一份预测分布的负对数似然当 predictive surprise,超过阈值就插入,另外每 N=5 帧保底插一帧。实现里阈值 K=0。
TUM 和 ScanNet,RTX 4090。
| 方法 | TUM ATE (cm) | ScanNet ATE (cm) | Depth AUSE |
| LoopSplat | 3.33 | 7.7 | 未报 |
| VarSplat | 3.20 | 6.5 | 0.2752 |
| CG-SLAM | 4.0 | 8.1 | 0.1842 |
| BayesianGS | 3.12 | 6.7 | 0.1060 |
TUM 平均 ATE 3.12 cm,表上最低。ScanNet 6.7 cm,略高于 VarSplat 的 6.5,三次重复的波动更小。颜色 AUSE 0.0121,和 VarSplat 的 0.0123 持平;深度 AUSE 从 CG-SLAM 的 0.1842、VarSplat 的 0.2752 降到 0.1060。渲染在训练关键帧上评,TUM PSNR 23.30,略高于 LoopSplat 22.72 和 VarSplat 23.14,这不是新视角对比。
关键帧:fr1/desk 从每帧 591 降到 137,fr2/xyz 3393 到 744,fr3/office 2514 到 545,大约 70%。FPS 0.56,快过带不确定性的 VarSplat(0.47),慢过不算不确定性的 LoopSplat(0.59)。
跟踪目标消融:普通 L1 在 fr1/room 失败;完整高斯 NLL 平均 ATE 42.44 cm;带 log 项 49.68 cm;归一化 L1 平均 4.18 cm,五条都跟上。打开跟踪和关键帧模块后,TUM ATE 从 3.47 到 3.12,关键帧从 1689.8 到 380.6。
不确定性如果只躺在建图损失里,对 SLAM 几乎没帮助。这篇让同一张预测方差同时降权不可靠像素、少建已经解释好的帧。深度 AUSE 的提升说明透明度扰动对几何更关键,只学颜色方差不够。手持和车载 RGB-D 有定性建图结果,至少说明能离开基准数据集。
跟踪精度是渐进的,TUM 只比 VarSplat 好 0.08 cm。真正能省的是建图次数。
渲染质量在训练关键帧上评,不能当新视角 SOTA。ScanNet ATE 没有超过 VarSplat。K=0 意味着任何正 surprise 都可能插入,实际筛选力度有多大,论文没把阈值曲线画全。少建图会推迟地图 refinement,准则漏掉信息帧时会滞后。一阶线性化加高斯假设在强遮挡、强非线性处可能不准。FPS 仍低于 1,还不是机载实时。手持/车载只有定性图。