五维结构化先验把检测器 OoD 幻觉压到个位数 FPR95

SPK: Eliciting Structured Prior Knowledge for Interpretable Out-of-Distribution Detection in Real-Time Object Detection

Changshun Wu, Weicheng He, Xiaowei Huang, Saddek Bensalem

cs.CV, cs.LG

2026-08-20

SPK 从冻结检测器引出部件语义、几何、上下文五维先验,iForest 做拒绝:YOLO+BDD Far FPR95 从 65.23 降到 0.70,多数设置上超过要微调检测器的 Proximal-OoD。

这篇在解决什么

目标检测器在封闭类别上训练,开世界里却会给训练集没有的物体打出高置信框。这类错误叫 OoD hallucination(分布外幻觉):近端是长得像已知类的物体,远端是背景纹理把 objectness 点着。现有路子两头走。事后在检测器高维特征上堆打分函数;或者微调检测器本身去压幻觉。两边都还在那团不透明表示上转,没有把检测器已经学到的先验拆开。

SPK 问的是另一句话:检测器内部到底已经编码了哪些、能用来判断这次预测靠不靠谱的先验?把它们引出来,压成可解释的短向量,再做拒绝。

方法

检测器权重冻结。幻觉样本当诊断信号,不当 outlier exposure 的拒绝标签,也不拿去改检测器。

语义先验:对每个 ID 类训一个轻量四层残差卷积头,把该框的 RoI 特征解码成部件级概念激活。概念词表三类来源,ID 部件、近端 OoD 部件、背景概念。近端类用 GPT-5 按 VOC/BDD 类别去 Objects365 里挖,背景来自 DTD 再过滤。部件标注有自动工具,仍需少量人工核对。训练三项损失:Dice 重建概念掩膜、抑制不该亮的通道、三组(id / prox / bg)的分组交叉熵。每组取该组最大通道激活,得到三维语义响应。

几何先验是框相对整图的面积。上下文先验把整图当 RoI,用检测器颈部多尺度特征的通道均值和标准差做图级嵌入,再对 ID 训练图的类条件库做 KNN 距离。

五维向量:\([s^{id}, s^{prox}, s^{bg}, r^{geo}, d^{ctx}]\)。下游可以接 MDS、BAM、KNN、Isolation Forest,论文主推 iForest。

结果

校准评测协议,三种结构 YOLO、Faster R-CNN、RT-DETR,两个 ID 集 PASCAL-VOC 和 BDD-100K,Near-OoD 与 Far-OoD。指标是 FPR95(ID 召回 95% 时的假阳率,越低越好)和幻觉条数。

同一套 iForest,换成 SPK 五维之后 FPR95 大幅下降。YOLO + VOC Near/Far:70.27 / 67.82 降到 14.25 / 11.84。YOLO + BDD Far:65.23 降到 0.70。Faster R-CNN + BDD Near/Far:63.25 / 62.78 降到 2.31 / 1.52。

幻觉条数对比会改检测器的 Proximal-OoD:

检测器 / 数据原始Proximal-OoDSPK
YOLO VOC Near/Far946 / 440134 / 60135 / 52
YOLO BDD Near/Far701 / 66680 / 4769 / 5
Faster R-CNN VOC2150 / 1335710 / 253299 / 140
Faster R-CNN BDD2576 / 1634207 / 16760 / 25
RT-DETR VOC2311 / 1589386 / 470358 / 275
RT-DETR BDD3145 / 1220525 / 240359 / 113

YOLO + VOC Near 上 SPK 和 Proximal-OoD 基本打平(135 对 134)。拉开差距的是 Faster R-CNN 和 BDD Far。消融:三项语义损失齐上,YOLO 四格平均 FPR95 为 9.16;拿掉 Dice 升到 20.80。只留语义是 21.17,加上几何 12.36,再加上下文 9.16。BDD 十类的全部语义头,单卡 A100 40GB 大约一小时。

为什么重要

检测器不用微调,幻觉拒绝就能超过「微调 + KNN」的 Proximal-OoD。对已经冻结上线的 YOLO / DETR 这很实际:加一层五维监视器,不碰原权重。五维还可读,id 组弱、prox 或 bg 组强,比看一段 256 维特征更接近事故分析。论文的判断也直白:先把表示空间做对,比再发明一个打分函数更值钱。

局限与存疑

没有独立的局限节。作者承认目前只覆盖近端物体和背景两类幻觉源,生成侧预防仍是未来工作。近端挖掘绑在 GPT-5 加 Objects365 上,换域要重挖。部件标注仍要人工过一眼,概念词表质量没有单独量化。几何先验只是相对面积,粗。YOLO + VOC Near 的条数没有赢 Proximal-OoD,SOTA 不是每一格都成立。SPK 是事后拒绝,幻觉框还是会先被检测器画出来。校准基准之外,若干老方法只在未校准设置上比过。

术语

原文与代码

相关论文

全部论文解读