EviBack 只在零奖励轨迹上请教师兜底,1.7B agentic RAG 的 F1 反超 Search-R1

EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

Xiao Ma, Zhiquan Hu, Yi Wei, Chenchen Zhao, Yijun Chen, Jicheng Zhao, Yuming Li Chuang Dai

cs.AI

2026-07-27

用最终答案对错当奖励训练搜索 agent 时,近七成 rollout 组整组零奖励、没有对比信号。EviBack 给这些组单独补一个冻结教师(GLM-4.7-Flash)做证据评估,在七个 QA 基准上 F1 全面超过 Search-R1。

这篇在解决什么

用强化学习训练能多轮搜索的 agentic RAG(检索增强生成),主流做法是 Search-R1 那一类:让 Actor 模型自己搜、自己答,拿最终答案的对错当奖励信号。问题是这个信号太稀疏。论文统计了 512 个八条轨迹的 rollout 组,只有 27% 里存在「一条答对、其余答错」的对比信号;剩下 69% 是整组零奖励,RL 在这种组上学不到任何相对偏好。

更麻烦的是「零奖励」混了三种完全不同的失败:64.5% 是证据压根不够、答不出来;16.7% 是语义对了但字符串没对上;18.9% 是证据够了但答案写错或没写全。一刀切当成失败,等于把「证据不足」和「答案没对齐」两种情况混训,模型学到的改进方向是错的。

方法

EviBack 的思路是给那些整组零奖励的 rollout 单独补一份辅助监督,同时不碰那些已经有人答对的组(那些组照常用 Actor 自己的可验证奖励)。补监督靠一个冻结的 Teacher 模型(实测用的是 GLM-4.7-Flash),分两段走。

关键的硬约束是:阶段 B 不许推翻阶段 A 的「I」判定。只要证据被判为不够,哪怕参考答案长得像,也不能假装答得出来。这条门把「证据不足」从「答案没对齐」里彻底剥开。

这个两段式 Teacher 本身是用一条端到端的自动 prompt 工程管线(E2E-APE,借助 GPT-5.5)从一个人写的单 prompt 初版自动拆解、打标、消融、选出来的,替换的是「靠人手调 judge prompt」这件苦活。

结果

在七个开放域 QA 基准上,三个 Qwen3 规模都对比 Search-R1。

规模Search-R1 F1EviBack F1提升
0.6B0.24310.2490+0.0059
1.7B0.25090.2911+0.0402
4B0.40440.4177+0.0132

1.7B 提升最明显(95% 置信区间不含零),单跳 macro F1 从 0.3359 升到 0.3985,多跳从 0.1785 升到 0.1975。更关键的是搜索行为变干净了:有效答案率从 0.73 升到 0.86,平均搜索次数从 1.73 降到 1.59,重复查询和撞到最大轮次的强制终止都降了。论文统计有 593 道题从「无有效答案/撞死」救回到有效答案,只有 140 道退步。

为什么重要

做 agentic RAG 强化学习的人会直接撞上「零奖励组占大头」这个问题。EviBack 给了一个不破坏可验证奖励原则的解法:Teacher 只在零奖励组兜底,推理时完全不在线。它把「证据够不够」和「答案对不对」拆成两件事分别判,是这篇最有迁移价值的部分。

E2E-APE 自动造 Teacher 这条副线,对那种 judge prompt 全靠人调的工作流也是个提醒。

局限与存疑

作者自己承认几点:试过更细粒度的信号(查询质量、证据冗余、停止置信度),没找到能稳定涨点的组合,所以现在的奖励仍偏保守;训练集和评测集都是从原数据集里采样的子集,不能直接外推到全量。

更值得留意的是规模上的代价:到了 4B,F1 涨了但平均搜索从 2.05 升到 2.50、重复查询率从 13.7% 升到 24.8%,说明 Teacher 介入本身会推高搜索量,规模越大这个控制成本越明显。这篇的 F1 绝对涨幅不大(0.6B 那档置信区间还跨零),它真正的贡献在行为层面的改进,不是刷榜。

术语

原文与代码

社区讨论

相关论文

全部论文解读