不重训基座、一步离散扩散修正 SSC,隐藏测试 mIoU 到 38.8%

Generative Semantic Scene Completion

Shi Chen, Weifeng Ge

cs.CV, cs.LG, cs.RO

2026-08-27

复旦把室外 LiDAR 语义场景补全做成离散扩散三件套:合成稀有类配对数据、从噪声生成、一步修正冻结基座。S2D2 不重训,SemanticKITTI 隐藏测试单帧 mIoU 从 SCPNet 的 36.7% 提到 38.8%。

这篇在解决什么

室外自动驾驶里,一帧 LiDAR 只能打到目标体素网格大约 1% 的格子。语义场景补全(SSC)要同时补几何、打 19 类语义标签。SemanticKITTI 的网格是 256×256×32,覆盖 51.2×51.2×6.4 米,分辨率 0.2 米。空体素大约 95%。有标签的点里 vegetation 占 26.7%,motorcyclist 只占 0.0037%,差了七千倍以上。

判别式网络就在这个直方图上训练。稀有类、细杆、鬼影拖尾、边界和遮挡全是硬伤。SCPNet 隐藏测试上的逐类 IoU 跟训练集频率 Pearson 相关 r=0.80:规划最需要的路人,训练里最少。改损失权重、从同一序列榨更多监督,直方图本身不动。

方法

GSSC 用同一套多项离散扩散干三件事。离散扩散不往高斯噪声里搅连续值,按转移矩阵重采样体素类别。

结果

隐藏测试上,冻结 SCPNet 加 S2D2 一步、无测试时增强,mIoU 38.8%,比 SCPNet 公开的 36.7% 高 2.1 个百分点。论文把这条标成目前最强的因果、单帧、单样本成绩。四步加八视角 TTA 到 39.2%,已经出了这条限制。四帧 SCPNet 是 47.5%,TALoS 用测试时适应做到 37.9%,都不在同一谓词下。

验证集上自家移植的 SCPNet 是 36.17%,加一步到 38.54%(+2.36)。SemCity 用连续先验修同一基座的官方权重,从 37.55% 到 38.19%,补全 IoU 抬得更多(+9.0 对这边的 +2.8)。两边可以当同一量级,不好硬排。从噪声的 SGSC 验证集 30.5%,再修一次到 32.8%,仍比判别式基座低 3.3 个百分点。

方法划分mIoU补全 IoU
SCPNet 公开test36.756.1
TALoStest37.960.2
SCPNet+S2D2(N=1)test38.858.9
SCPNet+S2D2(N=4+TTA)test39.259.0
自家 SCPNetval36.1749.9
+S2D2(N=1)val38.5452.7
SGSC 从噪声val30.553.6
SGSC+S2D2val32.855.4

三个冻结基座都能抬:LMSCNet +1.8,JS3C-Net +1.6,SCPNet +2.36。SCPNet 上 19 类里 18 类涨,bicyclist 和 truck 各 +5.3,road +4.6;杆、栏、树干几乎不动。去掉 KL 只留交叉熵会塌到 10.3%;只留 KL 停在 36.1%,跟基座一样,等于没修。N=1/4/100 分别是 38.54 / 38.65 / 38.2,一步已经够。

为什么重要

这是给已部署 SSC 栈加的修正算子,不是再训一个补全网络。SCPNet 官方代码还卡在已下架的 spconv 1.0,这篇也没把移植权重重提隐藏测试。能拿现成预测当源,花一次前向换大约 2 个点的 mIoU。论文测到修正耗时 107 毫秒,整条流水线在空闲 H100 上 3.23 FPS,基座单独 4.95。PS3 数据池和代码都开源。

从噪声生成这一路目前还打不过判别式基座。能落地的是第三种角色:修别人已经产出的体素标签。

局限与存疑

修正不能越过源的天花板。JS3C-Net 上 VRU-IoU 从 3.8 掉到 2.4,person 8.7→5.9,bicyclist 2.6→1.2;有一帧行人 IoU 从 36.6 被擦到 0.7%。弱基座上 building、truck 也会被减分。可迁移范围被收窄到体素网格原生的基座。

motorcyclist 验证集 +8.3 复现不了:重训只剩 +0.3,隐藏测试 1.8→3.1。安全相关三类均值,S3CNet 以 32.6 领先这篇的 21.6。细结构几乎没动,遮挡没有单独实验。

延迟也没赚回来。按 1 秒反应窗算,DW-VRU-IoU 验证集 50.7→49.9,测试集 54.9→49.7,修完比不修还差。测试集上精度增量还填不了多出来的时间。零样本转到 SSCBench-KITTI360 的 mIoU 只从 5.8 到 6.2,落在单种子噪声带里,站得住的只有补全 IoU(18.1→19.5)。SemanticPOSS 上 mIoU 1.0→6.5、补全 IoU 31.8→54.9,但真值是自行重建的,不能跟 TALoS 硬比。

自家移植的 SCPNet 验证集比原论文 37.2% 低 1.0 点,比 SemCity 引用的官方权重低 1.4 点。隐藏测试 +2.1 是相对 SCPNet 公开分,不是相对他们自己能复现的那份权重。

术语

原文与代码

相关论文

全部论文解读