Robustness of IR Models to Collection Growth
Emmanouil Georgios Lionis, Debasis Ganguly, Sean MacAvaney
cs.IR, cs.CL
2026-08-25
格拉斯哥把新冠语料并进MS MARCO来测语料增长公理。BM25的nDCG@10从0.645掉到0.503,独立打分的SPLADE和RetroMAE只掉几个点,重排序器几乎不动。
线上检索的文档库几乎每天都在涨。理想情况是:给某个查询加一堆无关文档,排在前面的相关结果不该被挤下去。格拉斯哥大学把这条直觉写成 Collection Growth 公理,并设计了一个可控实验来打现有模型。
他们合并两套几乎没有主题重叠的标准集:疫情之后的 TREC-COVID,和 2019 年以前的 MS MARCO / TREC DL-2019。合并后 910 万篇,COVID 只占 1.9%。对 COVID 查询来说,MARCO 段落就是外来噪音;对 DL-2019 查询来说,COVID 文档几乎全是题外话。这样就能问:加噪音之后,nDCG 掉多少。
模型按打分时要不要看别的文档分成两类。MDA(Multi-Document-Agnostic)只看当前查询-文档对,包括稠密双塔 RetroMAE、稀疏双塔 SPLADE、逐点重排 monoELECTRA。MDD(Multi-Document-Dependent)会吃集合统计、候选列表或邻域,包括 BM25 的 IDF、伪相关反馈 RM3 / VectorPRF、上下文文档嵌入 CDE、列表重排 Set-Encoder。
评测看三件事:nDCG@10、一阶段召回质量(COVID 用 P@100,DL-2019 用 R(rel=2)@100),以及 Collection Precision@10,即前十里还有多少来自「本该命中」的那份子库。伪相关反馈固定用前 10 篇,重排器重排前 100。
掉点是不对称的。COVID 查询的 ΔnDCG@10 落在约 -0.244 到 -0.019,没有模型满足公理;DL-2019 几乎不动,约 -0.009 到 +0.002,CP@10 接近 1。作者把不对称归到两件事:检索器普遍在 MARCO 上预训练,且 MARCO 占合并库的 98.1%。
一阶段里,MDA 更扛。TREC-COVID 异构库上 RetroMAE 的 nDCG@10 是 0.735,SPLADE 是 0.700;BM25 从 0.645 掉到 0.503(-22.0%),CDE 从 0.801 掉到 0.716(-10.7%)。SPLADE 只掉 3.9%,RetroMAE 掉 4.8%。
| 一阶段 | Hom nDCG@10 | Het nDCG@10 | Δ |
| BM25 | 0.645 | 0.503 | -22.0% |
| CDE | 0.801 | 0.716 | -10.7% |
| SPLADE | 0.728 | 0.700 | -3.9% |
| RetroMAE | 0.772 | 0.735 | -4.8% |
伪相关反馈帮不上小库。COVID 上 RetroMAE 加 VectorPRF,异构 nDCG 从 0.735 降到 0.728;CDE 的 CP@10 从 0.924 降到 0.906,反馈把查询拽向了占优的 MARCO。重排器几乎免疫:CDE 后面接 monoELECTRA 是 0.779,接 Set-Encoder 是 0.775。DL-2019 上 Set-Encoder 还略高一点(SPLADE 后面 0.781 对 0.767)。
生产索引不会停在评测那天的快照上。这篇把「库变大了指标却掉了」从 anecdata 收成一条可测公理,并指出伤害主要发生在一阶段、发生在那个变小的子库上。BM25 这类吃全局 IDF 的模型,对新来的题外文档特别敏感。如果第一段已经是独立打分的稀疏或稠密检索,后面的列表重排对这类噪音并不更脆。
PRF 在这里的表现值得单独记一笔:它会强化已经占优的子库,查询如果属于少数主题,反馈等于给自己加干扰。
作者承认只配了一对语料,注入比例只有 1.9%,而且多数神经检索器都在 MS MARCO 上预训练。不对称结果有多少来自「文档互相依赖」,有多少来自预训练域和体量碾压,实验拆不开。公理允许一个小的 ε,正文没有给出应该接受的 ε 取值。只用 DL-2019 的 50 条查询代表大库一侧,统计量偏瘦。换一对主题重叠更高、体量更接近的集合,MDA 领先多少还不好说。