池化 LLM 打标复用 65%–80%,检索选型成本最高降 4.9 倍

Incremental Pooled LLM Evaluation for Cost-Effective Retrieval Model Selection

Max Nelson, Hanoz Bhathena, Aviral Joshi, Saket Sharma

cs.IR, cs.CL

2026-09-02

把候选检索系统的召回文档并成池、用 GPT-4.1 增量打标,四套基准 nDCG@10 与人工 ρ 达 0.69–0.95,生产评 62 套配置成本最高降 4.9 倍。

这篇在解决什么

生产 RAG 换 embedding 时,要比的是相对名次,不是一份永远够用的人工 qrels。TREC 式人工池化贵、慢,新系统一来就得重做;各系统独立让 LLM 打标,重叠文档会被打很多遍。JPMorgan 面对的是更具体的约束:金融新闻问答要在 dense、sparse、hybrid 一堆配置里选型,还要把新模型持续加进来。

经典池化还有一个坑。没进池的文档默认不相关,检索行为越新越吃亏。

方法

当前候选系统对每条 query 取 top-k,文档取并集,LLM 对每个唯一 (query, doc) 打 0/1/2 分,再用这套共享判断算 P@k、nDCG、MAP。新系统加入时只给它新贡献的文档打分,旧分原样复用。

打分模型钉死为 GPT-4.1(gpt-4.1-2025-04-14),temperature 0,单轮、无 few-shot。提示要求先写不超过两行的 thought,再输出 JSON 分数。公共实验里 11 套系统(5 家 embedding 的 dense 与 hybrid,加 BM25)各取 top-100。

P@k 和 DCG@k 只看系统自己的 top-k,池子变大分数不变。Recall、AP、nDCG 的分母随池子变,单条 query 内两两名次仍保持;跨 query 宏平均没有定义上的保证,要用实验核对。

结果

四套基准是 FiQA、TREC-COVID、NQ(取前 500 条)和金融多模态 FinRAGBench-V。nDCG@10 与人工 qrels 的 Spearman ρ:FiQA 0.909、TREC-COVID 0.691、NQ 0.945、FinRAG-V 0.909。11 系统 55 对里,nDCG@10 两两同序约 78%–91%。意见不合的 27 对里,20 对(74%)落在人工 qrels 自己的 bootstrap 噪声里,真正名次冲突只剩 7 对。

公开集上池化相对独立打标省约 65%–67% 标注。生产新闻 QA:约 30 万页、303 条 query、62 套配置,最终 766,350 条唯一判断,相对独立评测的约 376 万次复用率 79.6%,成本约 4.9 倍。四星期增量建池,GPT-4.1 花费约 800 美元。选出的生产配置是 hybrid-emb3-large-256,MAP@100 为 0.461,与 768 维 hybrid 的 0.459 几乎持平。

同一 judge 重打 1000 对,三档完全一致率 93%–96%(κ=0.84–0.90)。Claude Sonnet 4.6 与 GPT-4.1 条目级二值一致率 84%–92%,但 TREC-COVID 全池重打后系统排序 ρ=0.89(nDCG@10),两两同序 89%。条目级吵归吵,系统名次大体还在。

留一家族分析用来量化经典 pool bias:拿掉某家 embedding 独有文档并当不相关,FiQA / TREC-COVID 分别冒出 8 和 10 对名次翻转,nDCG@10 最大惩罚 0.033 和 0.055。把新文档都打上分后,这 19 对错误全部消失。生产侧还看到 hybrid 能填上降维损失(256→768 的 MAP 差从 dense 的 +0.029 收到 +0.012),指令式改写 query 则让所有系统 MAP 平均掉 0.039。

数据集nDCG@10 ρ判断复用率
FiQA0.90965%
TREC-COVID0.69166%
NQ0.94566%
FinRAG-V0.90967%
生产 62 套配置79.6%

为什么重要

对要持续换 embedding 的团队,这把「每次新模型重标一遍」变成「只标新捞到的文档」。同一池子还能事后回答当初没排进实验的问题,例如 hybrid 下维度还重不重要,不必再花标注预算。绝对分数会被 LLM 更宽的相关口径抬高或压低,偏移在系统间大体均匀,所以适合比谁更好,不适合当绝对 nDCG 对外报。

局限与存疑

分差小于 0.001 nDCG 的近并列,人工和伪标签都分不开。主结果绑在一个钉死的 GPT-4.1 上,Sonnet 只在 TREC-COVID 全量验证过;更小或领域模型会怎样没测。系统全是单阶段检索,没有 reranker。宏平均在池扩张时的稳定性是实验观察,不是定理。生产 query 里大量是 LLM 生成的,和真实流量分布可能有偏差。

术语

原文与代码

社区讨论

相关论文

全部论文解读