Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding
Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen
EMNLP 2026 Findings
cs.AI
2026-08-25
检索文档会抬高抄写token的logprob,题内置信度被压平;用答案与检索文档的词面重合投票,四基准最高+5.4点,少数正确题+35点。
单轮推理里,用token对数概率给并行采样加权投票(DeepConf这一路)常常比简单多数好。搜索agent把检索到的文档追加进上下文后,这条信号会坏。原因被写成copy inflation:模型从刚贴进来的文档里抄词,这些token的logprob被系统性抬高,同一题下各条轨迹的置信度被压平,加权投票退化成数人头。
在BrowseComp-Plus、Tongyi-DeepResearch的轨迹上,抄自文档的token比非抄词平均高0.50 nats。中位轨迹有93%的内容token是从自己检索到的文档里抄的,81%的轨迹抄写比例不低于90%。随着抄写比例升高,DeepConf分数的题内方差占比从0.39掉到0.20。即使八条轨迹全错,DeepConf的题均分仍有峰值的87%;对错轨迹的分数分布重叠54.2%。
Retrieval-Grounded Voting不再读模型内部的logprob,改读环境给的检索日志。对每条轨迹,取最终作答文本(不含内部思维链)与该轨迹检索到的文档集合,权重是作答词项落在单篇文档里的最大覆盖率:分子是作答与文档的词项交集大小,分母是作答词项数,再对文档取max。选max是为了避免无关文档把真正支撑段落稀释掉;用作答侧归一化,是避免长文档惩罚一条本来锚得住的短答案。
这个分数直接代入加权多数。答案串做轻量归一化后聚类,权和最大的簇胜出。不需要logprob,不微调,也不额外打一次模型。CPU上大约每条轨迹0.3毫秒。
四个搜索agent基准(BrowseComp-Plus、BrowseComp、GAIA、FRAMES)×五个模型(Tongyi-DeepResearch、gpt-oss-120b、MiniMax-M2.7、Kimi-K2.5、GLM-5.1),每题8条轨迹。20个格子RGV全是最高。
最大一格是BrowseComp-Plus上的Tongyi:单条51.6,简单多数62.0,DeepConf 65.7,RGV 71.1,oracle 74.2,相对DeepConf +5.4点。BrowseComp上开网页噪声更大,MiniMax从DeepConf的46.0到50.7。FRAMES单条已经84%以上,增益缩成零点几到一点,但没有格子退步。
难例最能说明问题。在830题的Tongyi/BrowseComp-Plus上,正确轨迹只有1–2/8的少数正确题,RGV 84.4,DeepConf 49.2,差35.2点。RGV用4条轨迹就到65.9,和DeepConf用8条的65.7持平。对错轨迹的ROC AUC是0.908对0.837。有金标支撑文档时,正确轨迹的金文档召回0.94,错误的0.31;RGV与金召回的相关0.57,DeepConf是0.36。信号主要来自数字和专名,普通实词几乎不分对错。
搜索agent的测试时扩展,投票层可以不碰logprob。文档已经在轨迹里,词面重合几乎免费,四条轨迹打平八条置信度投票。任何消费token置信度的机制(早停、路由、拒答、用logprob做幻觉检测)在检索进上下文之后,读到的都是被抄写抬高的信号。
方法本身极简,迁移成本低。它测的是检索有没有把答案锚住,不测答案是不是真。
接地不等于正确:616道存在正确轨迹的题里,26道(4.2%)是错轨迹检索了同主题文档、靠复述拿了更高分,论文称为well-grounded but wrong。强制短实体答案时,分数退化成答案是否出现在文档里,与DeepConf打平。检索质量差时RGV上界跟着掉;检索贡献很小的任务上它也帮不上。非检索工具(代码解释器)需要另一套接地信号。实验主要是英文。投毒语料可以抬高抄写轨迹的分数,这个漏洞凡读检索日志的方法都有。多数格子每基准最多抽150题,机制分析的830题只在Tongyi×BrowseComp-Plus。