EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents
Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Shu Wu, Bowen Song, Liang Wang
cs.CL
2026-08-03
EviSD把训练集自带的支撑证据和标准答案当特权信息,只精细调制搜索、回答两类动作的token信用,七个问答基准EM超过最强基线1.3~2.3分。
搜索增强的语言智能体要学会在多轮交互里判断「什么时候查、查什么、什么时候收手回答」。用强化学习训练这类智能体时,常见做法是只看最终答案对不对,给整条轨迹一个统一的结果奖励(GRPO 这类方法把它转成组内相对优势,再均匀分给轨迹里每一个生成的 token)。问题是一条轨迹可能有好几轮搜索、好几次改写查询,某一轮搜到了关键证据,另一轮搜的是废话,但结果奖励分不清谁的功劳大,对的答案可能是蒙对的,查询本身的信息量没有被区分对待。已有的改进方案要么引入额外的过程奖励(需要人工设计评判信号),要么靠同一个模型在特权上下文里重新打分再蒸馏给自己(on-policy self-distillation),但这些方法要么改了训练目标,要么把纠偏信号糊在了整条回复上,没有精确定位到搜索和回答这两类真正重要的动作。
EviSD 的做法是把训练数据里本来就有的「支撑证据」(为什么这道题该查这些内容)和「标准答案」当作特权信息:训练时用同一个模型,先按学生视角(原始上下文)采样出搜索或回答动作,再让同一个模型换成教师视角(拼进证据或答案的特权上下文)给这个已采样的动作重新打分,两次打分的对数似然差就是教师和学生的分歧信号。这个分歧信号只作用在两类 token 上——生成的搜索查询、生成的答案文本,其余的推理 token、检索回来的文档全都保持原来的 GRPO 优势不变。分歧信号通过一个 tanh 函数压缩成有界修正量,叠加到结果驱动的优势上:教师认可这个动作时,放大它的正向优势;教师反对时,削弱它的优势,但修正的方向永远和原始结果奖励一致,不会反转符号。推理时不需要这个教师视角,模型跟普通检索智能体一样工作。
在七个问答基准(NQ、TriviaQA、PopQA 三个单跳,HotpotQA、2WikiMQA、MuSiQue、Bambooogle 四个多跳)、三种不同规模/代际的骨干模型上,EviSD 的宏平均精确匹配(EM)都是所有方法里最高的,比最强的对比方法高 1.32.3 分。更关键的是它只对 6.7%15.1% 的回复 token 做了信号调制,说明这套设计确实精确定位到了决定成败的那部分内容,而不是笼统地重新分配奖励。消融实验支持了两个设计选择:换成「只给答案动作提供特权上下文」会让平均 EM 掉 2.1 分,说明搜索动作的证据特权是主要收益来源;把「局部动作调制」换成「全响应蒸馏损失」(类似 SDAR 的做法)会让 EM 掉 7.1 分,尤其在多跳任务上降幅更大,证明把纠偏信号收窄到具体动作 span,比对整条响应做蒸馏更有效。训练过程中,EviSD 达到相同成功率只用了 1.87 次搜索/轨迹(对比 SDAR 的 2.16、RLSD 的 2.27),说明它引导出的是更精准的查询,而不是更多次的检索。
这篇论文回答的是搜索智能体强化学习里一个具体的工程问题:怎么在不改变结果奖励这个「锚点」、不引入额外蒸馏损失、推理时零开销的前提下,把训练数据里已有的证据标注利用起来提高信用分配精度。对已经在用 GRPO 类方法训练检索/搜索智能体的团队,这提供了一个可以直接叠加的模块,不需要重新设计奖励函数,只需要有逐实例的证据标注就能用。
这套方法依赖数据集本身自带细粒度的支撑证据标注(论文用的是按来源文档分组的标注句子),没有这类标注的场景无法直接套用。论文测的是问答检索任务,搜索动作和答案动作的边界很清晰;换到工具调用更复杂、动作类型更多样的通用 agent 场景,「特权信息该配给哪个动作」这个设计决策要不要跟着扩展,论文没有讨论。另外,τ(调制锐度)和 λ(修正上限)这两个超参数是在 Qwen2.5-7B 上调好之后直接原样套到 3B 和 1.7B 模型的,论文承认更小模型是否需要重新调参没有专门验证。