PACE证据前载:HotpotQA少一半预算,最终召回反升19点

Less can be More: Relieving RAG Bottlenecks via Evidence Frontloading and Pressure-Adaptive Budgeting

Weibin Cai, Reza Zafarani

cs.CL, cs.IR

2026-08-26

免训练的PACE按边际证据覆盖把支撑文档推到候选前列,再按重排器与生成器排队压力收预算。HotpotQA只送20篇,完整证据召回从41.13%升到60.26%。

这篇在解决什么

RAG常被拆成「先检索、再生成」,效率工作也多打在后半段:压缩上下文、复用KV cache、调度prefilling。Syracuse这组用开放到达的在线仿真测了重排器和生成器各自的p95排队时间,结论是瓶颈会搬家。QPS升高或重排预算D变大时,上游cross-encoder会压过LLM。Qwen2.5-3B配MiniLM,参数比约92.5倍,低负载仍是生成更慢,QPS到2.5就翻成重排更慢。同一对Qwen-3B加DeBERTa,D=100、QPS到1时端到端延迟已被重排排队主导;D收到50,主瓶颈又回到LLM。上下文压缩能缩短生成排队,却减不掉已经堆在重排器门口的请求。

固定砍D会漏多跳证据。多跳问答要几段互补文档拼成证据链,MMR、Dartboard这类多样性重排还会惩罚语义相近、但必须一起留下的支撑文档。

方法

PACE(Prioritized Adaptive Coverage of Evidence)不训练新模型,在现有候选池上做两件事。

证据前载把「用更少文档盖住更多查询语义」写成边际覆盖目标。每个语义维度上,已选集的覆盖取加权表示的最大值,新文档只贡献尚未被盖住的部分。查询相关度来自检索分数,再用软锚点补一层:跟高相关文档相似的桥接段落也会被抬上来。目标被证明是单调次模的,贪心选择有(1-1/e)近似保证。检索器用splade-v3,非负表示正好满足覆盖公式的假设。

压力自适应预算看两边排队。重排积压时间不超过LLM积压就用Dmax=100;一旦重排更堵,就按整批扣减,下限Dmin=20。目标是在不让重排成为瓶颈的前提下,尽量多送候选。

结果

离线三条多跳集:HotpotQA 1087条、MuSiQue 2317条、2WikiMultiHopQA 2861条。HotpotQA和2Wiki只保留支撑证据已落在top-100里的查询,用来隔离排序质量与初检索失败。

固定预算下,PACE把完整证据推进到更靠前的位置。HotpotQA上标准稠密排序D=100时,重排后top-5完整证据召回41.13%;PACE只送20篇就到60.26%,送50篇到62.38%。Dartboard在D=20时同一指标掉到33.22%。2Wiki上标准D=100是48.76%,PACE D=20是53.94%。在线HotpotQA、QPS=1.8时,PACE选中的D大约是固定100的一半,重排后recall@5仍高出约20个百分点。少送、更干净,reranker更容易把完整证据抬进最终K=5。

为什么重要

这是给在线RAG的系统补丁,不改重排器权重,也不做多跳迭代检索。高QPS、大D的serving里,先把证据挤到前缀、再按排队压力收D,比只压生成侧更对症。次模保证让前载不是又一套调参启发式。已经在用SPLADE加cross-encoder的栈,可以接到候选进入重排器之前。

它解决的是证据有没有进top-K,不是答案写得对不对。渐进改进,但卡在ranking-heavy时很具体。

局限与存疑

论文没有单独的局限节。主指标是证据召回,端到端QA准确率没有放到同样位置。HotpotQA/2Wiki过滤掉top-100就缺证据的查询,等于假设初检索已经够用。在线仿真跑在约22GB的Quadro RTX 6000上,生成器是Qwen2.5-3B,自然结束、最多128 token。覆盖公式依赖非负表示,换点积稠密检索要另验证。压力估计用吞吐量和队列长度,突发负载或重排器本身加速会不会改结论,文中没有比。

术语

原文与代码

社区讨论

相关论文

全部论文解读