EXCISE: Query-Side Exclusion for Late-Interaction Retrieval
Mohammed Ali, Abdelrahman Abdallah, Adam Jatowt
cs.IR
2026-08-06
ColBERT 这类检索器处理「要 X 不要 Z」时会反向打分,把含 Z 的文档顶到最前。EXCISE 在查询端加两个共 150 万参数的模块识别被排除主题并重排,索引不动,在 ExcluIR 上把排除 success@10 从 0.058 提到 0.691,且不伤普通检索。
你搜「电动汽车,但不要特斯拉」,ColBERT 这类迟交互检索器会把特斯拉的页面排到第一。这不是偶发 bug,是打分公式的必然。ColBERT 给文档打分的方式是:对每个查询 token,取它在文档里的最强匹配,再把这些最强匹配加总。每个 token 都正贡献,所以「特斯拉」这些排除词反而给覆盖特斯拉的文档加了最多的分。作者管这叫「排除反转」,并证明它是 MaxSim 求和的一个恒等式推论,在 554 条 ExcluIR 测试查询里,该排掉的混淆负例有 57.8% 比正解分还高。
作者先做了一件关键诊断:难点不在打分,在识别被排除的主题。一个监督探针想从冻结向量里把正解和混淆负例分开,各层准确率最高才 0.57(随机是 0.50);九种不加训练参数的测试时干预也都救不回来。可一旦把被排除主题喂给它,一条简单的降权规则就能让 ExcluIR success@10 从 0.058 飙到 0.598。所以学习只需集中在查询端。EXCISE 三段式:一个 LoRA 检测器判断查询是否含排除、标出排除主题;一个排除适配器重嵌查询和 top-100 短名单,好把覆盖排除主题的文档区分开;最后按相对阈值降权并硬删最强匹配。两个模块共 150 万参数(主干 2.98 亿),索引一个字节都不改。检测器不带排除时静默,直接返回原排序。
| 系统 | ExcluIR | FiQA | TREC-COVID | EUR-Lex | 无害 nDCG | 布尔 NOT |
| 冻结 ColBERT | 0.058 | 0.087 | 0.134 | 0.061 | 0.513 | 0.292 |
| 全量微调 | 0.491 | 0.317 | 0.507 | 0.214 | 0.496 | 0.692 |
| EXCISE | 0.691 | 0.620 | 0.671 | 0.429 | 0.516 | 0.899 |
(Reason-ModernColBERT 主干,六个文库里 EXCISE 全胜 18 个「主干乘文库」格。)亮点不止分数高:全量微调会用普通检索的代价换排除能力(无害 nDCG 从 0.513 跌到 0.496),EXCISE 反而微升。布尔 NOT 准确率从 0.25 到 0.29 提到 0.90 到 0.92。开销也小,检测器每查询 12.7ms,触发时再重嵌 15.1ms,最坏 1.4 倍冻结延迟。它还超过了所有在 1,860 条查询上池化的微调交叉编码器。
对做检索系统的人,尤其法律 e-discovery、系统综述、合规检索这些一条错结果代价很高的场景,这是一个能直接挂上、摘下都不用迁移的查询端补丁:索引不动,改不改全在查询路径。更重要的是它的方法论示范,先把任务里需要学习的部分隔离出来(识别主题),再把学习集中到那一点(150 万参数就够),而不是去微调整个编码器然后重新索引全库。检测器误触发时的安全性也有保证:没真排除时证据分平坦,惩罚接近均匀,不改变排序,论文给了命题证明。
重嵌只在 top-100 短名单内做,救不了一阶段召回:正解不在前 100 里,后面再怎么重排也没用,EDGAR 文库涨幅较小就是这个原因。硬删除上限是删 3 条,一个既强匹配排除主题、又强匹配目标主题的文档可能扛过降权留在前十。检测器依赖一个跨三主干共用的阈值 0.76,作者承认若某主干误触发率超标就得各自调,跨主干比较会混入阈值差异。