CoVeR: Coverage-Based Routing of Verifier Calls in Agentic Retrieval
Daeyoung Roh, Donghee Han
cs.CL, cs.IR
2026-09-03
多跳检索Agent用冻结句向量覆盖度余量跳过明显未覆盖的步骤,HotpotQA与2Wiki上验证器调用砍掉62%–68%,EM与始终验证相差不到0.3个百分点。
检索Agent回答多跳问题时,会连续发查询、攒证据,每一步都要判断够不够停。把这个判断交给LLM验证器或提示词裁判最稳,但验证器每一步都要把越积越多的证据再读一遍。论文在Self-Ask设定里量过,一题大约9到11次claim裁决,每次都是整包证据的完整阅读。
其中大量调用其实没悬念。缺的那一跳还没检索到,验证器几乎一定会说「继续搜」。CoVeR的判断是:明显没覆盖的状态,用冻结句向量的几何检查就能筛掉,只把模糊状态留给验证器。跳过只能推迟停止,不能自己喊停,所以不会引入未经裁决的提前结束。
问题先被拆成大约2条期望hop claim。冻结的E5句编码器分别嵌入claim和已检索句子。每条claim的覆盖度余量是1减去它与任意已检索句子的最大余弦相似度;状态余量取各claim余量的最大值。余量大,说明至少有一条claim附近还没有任何相近句子。
门控只设一个阈值τ。论文用留一数据集选出τ=0.16,三条数据集折到的值一样。余量大于τ就跳过验证器、继续检索;小于等于τ才调用验证器,并完全听从它的裁决。这是刻意的单侧设计:几何检查擅长发现「还没齐」,不擅长证明「已经够」。再加一条更低的提前退出阈值会破坏这个保证,主系统因此只用单阈值。
部署扩展里,一个约921k参数的MLP把头上的claim嵌入蒸馏成「问题→slot嵌入」,门控路径上不再需要LLM生成claim。验证器如果仍要读claim文本,被调用时还是要生成,always-verify基线同样付这笔账。验证器内部还可以按余量从大到小打claim,让「全覆盖」检查更早碰到未覆盖项;裁决本身与顺序无关,这笔节省只在串行打分时兑现。
主结果用训练过的coverage verifier(来自同期工作HALT的缓存轨迹),LODO阈值,HotpotQA/2Wiki/MuSiQue各约1000题。
| 数据集 | 三系统EM区间 | 验证器调用削减 |
| HotpotQA | 0.304–0.306 | 62.2% |
| 2Wiki | 0.184–0.187 | 67.8% |
| MuSiQue(饱和) | 0.080–0.081 | 93% |
三系统是跑满预算、每步都验证,以及CoVeR门控。EM差最多0.3个百分点,所有ΔEM的95%置信区间落在±1.2个百分点内。HotpotQA/2Wiki上门控Agent比跑满预算少做9.8%–11.9%的检索轮。MuSiQue上验证器只在2.6%的loop上开火,几乎每条轨迹都跑到预算上限,93%的削减测的是「不该停的时候乱跳也不会坏」,不能当可迁移的倍数。
覆盖度余量不能替代验证。用黄金支撑句当目标,AUROC能到0.89/0.90/0.83;换成可部署的生成claim字符串就掉到0.69/0.68/0.76。把余量硬拧成停止规则、并匹配验证器的coverage-safety,循环节省会掉到约0,规则在安全工作点上从不停止。匹配claim比判定claim被支持容易得多。
更便宜的路由器也够不着同一条前沿。在stop-loop一致率≥0.90的约束下,嵌入余量在HotpotQA上能切0.622,证据计数为0、词重叠0.512、BM25为0.202、廉价信号学到的组合为0.435。按CoVeR的调用削减率随机跳过,HotpotQA/2Wiki的一致率会再掉6.4/7.0个百分点。同一阈值不重调,能路由公开prompt judge、7B Agent和DeBERTa-v3 MNLI交叉编码器。开放语料HotpotQA Setting-B上调用削减92.1%,EM与两边基线统计上分不开;那是饱和点,验证器只在6.4%的题上开火。
对已经在用LLM验证器做停止判定的检索Agent,这是一层几乎零训练的过滤器。部署配方是:嵌入Agent本来就会生成的claim,在小训练集上选一个阈值,然后路由。门控侧还能蒸馏成不到11M的drafter。它不改停止策略本身,只降低把策略送到位的成本。
这是渐进的系统改进,不是新的停止算法。省的是验证器工作量:调用少62%–68%,claim-verdict对同样少62%–68%,输入token少72%/73%/97%。门控会推迟停止,每题最多多半轮检索。验证器调用和生成循环谁更贵,决定这笔账划不划算。论文没有给出与部署无关的端到端延迟结论。
证据只覆盖Self-Ask和一个封闭distractor池,开放语料只有一个饱和点。绝对EM只有0.08–0.31,HotpotQA上1个百分点以内的损失排除不掉。门控继承验证器的过早停止错误,余量否决不了这些错误:验证器和余量都被claim–证据相似度驱动,骗过验证器的假页面也会看起来「已覆盖」。E5在维基百科上预训练,离开维基百科可能变弱。每条轨迹只跑了seed-13一次。claim拆解在比较题、聚合题上会失败,论文没有量化。