REBASE 用背景子空间投影做免训练分割,X-Ray 上 mIoU 从 78.8 提到 86.3

REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation

Mantha Sai Gopal, Jaison Saji Chacko, Harsh Nandwana, Sandesh Hegde, Debarshi Banerjee, Uma Mahesh

cs.CV

2026-07-10

免训练的情境分割常被共享背景干扰。REBASE 用参考图背景特征的主成分做正交投影,把背景子空间从参考与查询特征里减掉,ISIC、X-Ray 上 mIoU 比 INSID3、GF-SAM 都高。

这篇在解决什么

情境分割(in-context segmentation)的目标是:给一张标注好的参考图,告诉模型「分割这种东西」,它在新查询图上把同类目标抠出来,不用为每个新类别重训。这是类增量学习(class-incremental learning)之外的一条省事路线。

现在的常见做法是把视觉基础模型(DINOv3 这类)拿来算参考图和查询图之间的 patch 相似度,再把最像的点喂给 SAM 出 mask。瓶颈在相似度图的质量:参考图和查询图如果共享大片背景(比如两张都是田野),背景区域的相似度被系统性抬高,提示点就落到了非目标区。对只占很小一块的部位级、可形变目标,这个问题最严重。

方法

REBASE(Reference-Background Subspace Elimination)的核心一步是「episode 级正交投影」。把参考图背景 patch 的特征做 SVD,取前 s 个奇异向量张成背景子空间 B,然后对参考和查询特征做投影:F̃ = F(I − BBᵀ)。直观讲,就是把「背景方向」从特征空间里减掉,留下更纯粹的目标差异。几个设计选择决定了它好不好用:

结果

主表(mIoU)上,REBASE 在五个数据集中的四个排第一:ISIC 63.8(INSID3 54.4、GF-SAM 48.7)、X-Ray 86.3(78.8、51.0)、FSS-1000 88.2(83.7、88.0)、PACO-Part 39.3(38.7、36.3)。唯一输的是 PASCAL-Part,REBASE 46.6 不及 INSID3 的 50.5,差距来自 INSID3 用的更新编码器 DINOv3-L。

消融(PACO-Part)显示各模块都有贡献:裸 baseline 29.54,加 SW-FPS 到 33.23,加稠密先验到 34.87,再加 REBASE 到 39.28,REBASE 单独贡献约 4.4 个点。换 DINOv3-L 编码器后,REBASE 在 X-Ray 再涨 19.70 个点,LVIS-92i +8.20,COCO-20i +7.10。成本上,单 episode 在 A100 上 281.1 ms,其中 REBASE 的 SVD 加投影占 84.5 ms(约 30%),开销可控。

为什么重要

对需要频繁引入新类别的分割应用,这把门槛从「采集数据 + 重训 + 存每个类的原型」降到「一张参考图」。REBASE 全程无训练,可插在现成的 DINOv3 + SAM 管线里,代价是每张图多花约 30% 推理时间。属于工程上直接可用的渐进改进,不是架构级突破。

局限与存疑

作者自己承认几处:PASCAL-Part 上 REBASE(46.6)输给 INSID3(50.5);SAM 3 的提示接口与这种稀疏点提示不太兼容,增益明显变小;REBASE 减掉的背景成分与 INSID3 的位置去偏成分高度重叠,两者叠用收益很小,基本要二选一。

一个边界要留意:超参 r 一旦大于 0.01,保留的背景奇异方向过多,性能持续下滑。说明方法对子空间秩的标定敏感,「一个 r 通吃」是在一个比较窄的区间里成立。

术语

原文与代码

相关论文

全部论文解读