不重建高斯原语属性,JEPA把重采样漂移压低23.7%

Gaussian-JEPA: Joint-Embedding Predictive Learning for 3D Gaussian Splats

Bin Ren, Qi Ma, Yue Li, Zongyan Han, Yidi Li, Yuqian Fu, Rao Muhammad Anwer, Theo Gevers, Fahad Shahbaz Khan, Salman Khan

cs.CV

2026-08-16

Gaussian-JEPA在3D高斯物体上做多尺度隐特征预测,不重建原语属性。匹配对照Gaussian-MAE下,重采样相对漂移降23.7%,遮挡55%检索R@1从19.80升到39.82。

这篇在解决什么

3D Gaussian Splatting 用各向异性高斯原语表示物体:位置、协方差、不透明度、外观绑在同一套参数上。资产里常常有几万个高斯,编码器只能吃固定预算。论文图 1 给了一个典型数字:34.3K 的资产被两次独立抽成 1K 个原语,物体没变,喂进网络的那一袋高斯却完全不同。这种变化不是数据增强,是稠密资产和固定预算编码器之间的随机实现。

现成的自监督主要走 Gaussian-MAE:mask 掉局部高斯组,用解码器把中心点和属性重建回去。监督绑死在这一次采样的那一袋原语上,还得在输入空间解码异构的几何和外观通道。Gaussian-JEPA 换了一条监督:从可见上下文预测被藏起来的 token 表征。JEPA 在图像和点云上已经有 I-JEPA、Point-JEPA、3D-JEPA。迁到高斯并不直接,每个 token 把几何、各向异性支撑、可见性和外观耦在一起,缺失证据的空间尺度也不齐。

方法

预训练用 Gaussian-MAE 放出的 ShapeNet55-GS,51,934 个训练物体。每个资产先做成 8,192 的缓冲,再无放回抽 1,024 个高斯。每个原语 14 维:中心 3、不透明度 1、尺度 3、旋转四元数 4、球谐 DC 系数 3。

Token 化沿用 Gaussian-MAE 的分组:按中心 FPS 选出 64 个组中心,每组 KNN 32 个邻居,PointNet 风格网络吐出 64 个 384 维 token。分组只看中心坐标,token 内容用全部 14 维。

64 个 token 里抽 4 个互不重叠的目标块,默认尺度为 [11, 9, 7, 5],合计 32 个目标,剩下 32 个当共享上下文。块从大到小依次采最近邻,粒度不同,mask 比例钉在 50%。不重叠只保证 token 中心索引不撞,底层高斯原语仍可能被多个邻域共享。

训练时三条通路同时工作:

预测损失是两路上的 Smooth L1。目标投影器不吃这条梯度,改由特征空间 grounding 训练:VISReg 管中心和尺度,再惩罚两路之间的交叉协方差。总损失是 Lpred 加 0.1 倍 Lground。EMA 动量从 0.996 线性升到 0.9999。

没有输入空间解码器,损失里也不出现中心、不透明度、尺度、旋转或外观。编码器是 12 层 Transformer,宽 384、6 头。300 epoch,batch 256,AdamW,在 H200 上预训练。下游只留在线编码器,21.83M,和 Gaussian-MAE 一样大。预训练一步慢 21.9%,峰值显存高 48.6%,因为每个目标块都要让 EMA 跑完整 token 场。

结果

对照基线是同一套高斯输入、同一套评测协议下的 Gaussian-MAE。点云数字只作参考,协议并不对齐。

重采样一致性在 ModelNet40-GS 全部 2,467 个测试物体上测,预训练没见过这些物体。每物体 5 次独立 1K 采样,1 个做 gallery、4 个做 query。相对漂移把同物体距离除以该编码器自己到其他物体的平均距离,避免跨表征空间直接比绝对值。

方法相对漂移 ↓R@1 (%)R@5 (%)
Gaussian-MAE0.340092.9598.89
Gaussian-JEPA0.259493.0099.36

相对漂移降 23.7%,96.2% 的测试物体更稳。R@1 几乎没动,稳定性不是靠表征坍缩换来的。

部分观测按空间方向挖掉一整块组。55% 组缺失、从完整 2,467 物体 gallery 检索时:

方法R@1R@5R@10
Gaussian-MAE19.8039.0249.14
Gaussian-JEPA39.8265.2875.95

R@1 高出 20.02 个百分点。30% 缺失时已经高 10.56 点,70% 缺失时仍高 13.36 点。配对 bootstrap 的 95% 置信区间不含零。这是整篇里最硬的差距。

形状补全在 ShapeNet55-GS 上:半空间裁出 512 个高斯,冻结编码器,用同一套解码器预测完整 1K。CD 从 0.0732 降到 0.0678(相对降 7.4%),F1% 从 6.62 升到 7.42,50% 可见度下 PSNR 16.03 升到 17.24 dB,SSIM 0.7148 升到 0.7469。三个解码器种子均值都站在 JEPA 一侧。

语义迁移是小步。ShapeNet-Part class mIoU 84.5,对上 Gaussian-MAE 的 84.2。ModelNet 全量微调:MN10 94.94 对 94.16(+0.78),MN40 92.63 对 92.54(+0.09)。冻结 backbone 时差距更大,MN40 线性探测 +1.50,三层 MLP +2.55。消融里,双投影加特征空间 grounding 把重采样 R@1 从单空间的 90.85 拉到 93.23;把 grounding 换成属性重建,R@1 掉到 88.18。

为什么重要

做 3DGS 资产检索、补全、冻结特征的人,这篇给了一条可复现的预训练目标:别把监督绑在某一次 1K 采样的原始属性上。编码器预算固定、资产却很密,是管线里的常态。

分类和分割上只是略强于匹配重建基线,别指望靠它刷 ModelNet 榜。点云方法在各自原协议下分类数字往往更高,论文也标了 dagger,不当匹配对照。

「decoder-free」只描述预训练没有输入空间解码器和属性重建损失。H200 上一步仍更慢、更吃显存。省的是下游,不是预训练账单。

局限与存疑

作者写明:只做物体级、固定 1K 预算;大场景、动态高斯、自适应预算都没碰。重采样评的是同一份源资产的随机抽样子集,两份独立优化出来的高斯资产算不算同一个物体,是另一个问题。输入仍是 14 维,球谐只留 DC,分组只看中心。geo 和 app 两路没有几何或外观标签,名字是功能划分。

ModelNet 全量微调方差本来就大。补充材料里,Gaussian-MAE 论文的 1K 到 4K 数字是 MN40 93.35,他们用官方代码复现是 92.46,Gaussian-JEPA 的 4K 迁移是 93.21。主文 1K 迁移 MN40 只高 0.09,这个数撑不起分类更强。补全 F1% 仍只有 7.42,绝对水平低,相对提升不能读成能补出可交付的完整高斯。预训练只在 ShapeNet 合成资产上,真实扫描高斯没有进入主评测。

术语

原文与代码

社区讨论

相关论文

全部论文解读