检索与训练两侧加保形闸,搜索 Agent 平均 EM 到 0.464

CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting

Zixi Zhu, Jiayuan Su, Jian Zhang, Yu Lin, Hongwei Wang

cs.AI

2026-08-21

CAS 在检索侧用 APS 按覆盖动态截断文档,在训练侧用 ACI 打折低置信 GRPO 轨迹。Qwen3-8B 七个问答集平均 EM 0.464,超过 Search-R2 的 0.446,多跳增益更明显。

这篇在解决什么

搜索 Agent 用强化学习把「想一步、搜一下」串成一条轨迹,固定 Top-K 检索和稀疏二值奖励会一起把可靠性打穿。K 太小漏证据,K 太大噪声进上下文;RL 往前走,模型越来越自信,幻觉答案和重复调用一起涨。浙大 ZJU-UIUC 与腾讯的工作把保形预测(Conformal Prediction,一种不依赖分布假设、能给有限样本覆盖保证的不确定性框架)接到检索和训练两侧,做成 Conformalized Agentic Search (CAS)。

目标不是再堆一个更强的搜索策略,而是给检索集合和训练轨迹各加一道可调的统计闸。

方法

检索侧用 Adaptive Prediction Set (APS)。搜索引擎先返回带分数的候选,softmax 成相关性概率,再按校准阈值累加,累到超过 q̂APS 就截断。简单查询集合变短,难查询集合变长,同时维持 1-α 的边际覆盖。默认 αAPS=0.2,平均带回 3.4 篇文档。校准集约 239 条查询,多跳题由 DeepSeek-V3.2 拆子问题并当相关性裁判。

训练侧用 Adaptive Conformal Inference (ACI),专门对付 RL 里策略一直在变、i.i.d. 不成立的问题。非一致性分数取 <answer> 段的平均负对数似然。滚动窗口估计分位数,低置信轨迹在 GRPO 损失里乘折扣 η=0.5。目标误差率 ρ 默认 0.25,αt 用 0.95 指数滑动平均跟踪,避免一步误差把集合撑爆或收死。

奖励仍是 Exact Match 加格式项。策略基于 Qwen2.5-3B-Instruct 和 Qwen3-8B,检索器 E5,语料 2018 Wikipedia dump,GRPO 每组 5 条轨迹,最多 4 轮搜索。训练数据混 NQ 与 HotpotQA。

结果

七个开放域问答集上,Qwen3-8B 的 CAS 平均 EM 0.464,超过 Search-R2 的 0.446 和 Search-R1 的 0.400。3B 上平均 0.401,比 Search-R1 高 0.065。增益主要在多跳:8B 多跳比 Search-R1 高 0.078,比 Search-R2 高 0.032;单跳相对 Search-R2 只高 0.001。

方法 (Qwen3-8B)单跳多跳总平均
Search-R10.4960.3290.400
Search-R20.5400.3750.446
CAS0.5410.4070.464

3B 消融:去掉 ACI,总分从 0.401 掉到 0.384,搜索次数更高更抖;去掉 APS 改固定 top-3,掉到 0.389。ρ=0.4 把近 40% 轨迹打成低置信,总分掉到 0.368;αAPS=0.05 平均 4.8 篇,单跳升到 0.504,多跳崩到 0.234。默认设置是覆盖和噪声之间的折中,不是越保守越好。

为什么重要

对在训 Search-R1 一类 Agent 的人,这篇给了一套不改骨干、只改截断和轨迹权重的插件。APS 用统计覆盖替换拍脑袋的 K;ACI 用答案段似然当置信,避开工具调用把显式置信表达打断的问题。代码已开源。单跳上相对 Search-R2 几乎打平,真正拉开的是多跳和少搜。

局限与存疑

实验几乎全在开放域问答,专业领域没测。APS 校准依赖 DeepSeek-V3.2 拆题和判档,弱裁判会把覆盖保证架空。统计保证停在终答,中间推理步没有覆盖承诺。Search-R2 闭源,3B 对比缺这一档。η、ρ、αAPS 都靠网格搜,换骨干或换检索器要重校准。保形预测的覆盖保证还依赖校准集与测试分布足够近,RL 前期分布漂移很大,作者用 ACI 在追,但早期尖峰说明静态 CP 在这里直接失效。

术语

原文与代码

社区讨论

相关论文

全部论文解读