CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
Boyang Liu, Senjie Jin, Peixin Wang, Zhangyue Yin, Yibo Wang, Yuhao Zhou, Xinbing Liang, Shizheng Zhu, Yuhui Wang, Jingqi Tong, Zhiheng Xi, Jiazheng Zhang, Clive Bai, Clarenceai, Blaze Chen, Tao Gui, Qi Zhang, Xuanjing Huang
cs.AI
2026-08-26
复旦与腾讯用同一套参数轮流当搜索智能体和critic,七个检索问答基准平均EM 52.5,比最强RL基线IGPO高2.1,答案幻觉率从17.6%降到12.6%。
Search-R1 一类方法用终点对错训练搜索智能体:何时搜、搜什么,都从最终答案里学。长轨迹里早期走偏,终点奖励说不清是哪一步错的,也来不及在当次搜索里把方向拧回来。Reflexion、Self-Refine、CRITIC 能给自然语言批评,但多半是事后提示,不是在轨迹里学会何时开口、开口之后该强化哪一段。ECHO 让 critic 跟着学,却要等整条轨迹跑完才发言。
真正难的是两件事绑在一起。智能体要学会何时请求反馈;写反馈的一侧要从被结局混淆的 rollout 里给出有用纠正。智能体一进步,失败模式就变,静态 critic 很快过时。
复旦和腾讯的 CAFE 用同一套参数扮演两个角色。智能体在中间步可以发出 <requestfeedback>,模型切到 critic 角色读当前轨迹、写出下一步该怎么改,再切回智能体接着搜。
冷启动不用理想轨迹替换失败。保留基座智能体自己走错的前缀,用 Kimi-K2.5 标出最早走偏的回合,插入请求和纠正,只留下修完能答对的轨迹做 SFT。模型因此学会在自己真实会去的状态上求救。
在线 RL 在 GRPO 上加两层信用。CFE 拿同一题里「请求反馈」与「不请求」两组的成功率差,加到请求侧的回报上,并惩罚第二次及以后的请求。反馈感知 advantage shaping 把一次成功救援拆开:请求前的 token 被降权,那是走偏的行为;请求后的 token 被加权,那是修好的行为。否则终点奖励会同时强化走偏和修好。
离线用 RDPO:从最近一轮 rollout 里,给同一题配一对「请求后成功 / 请求后失败」、前缀相近的轨迹,偏好成功那条的反馈文本。两边共享参数,这次更新会改下一轮两边的行为。默认日程是 100 步在线 RL 交替 5 轮。
主干是 Qwen2.5-7B-Instruct。域内只有 2WikiMultihopQA,其余六个都是域外。
| 方法 | 平均 EM | 平均 F1 |
| Qwen2.5-7B 基座 | 38.1 | 47.9 |
| SFT | 40.8 | 50.1 |
| SFT + GRPO | 49.7 | 58.0 |
| IGPO(最强 RL 基线) | 50.4 | 59.4 |
| CAFE | 52.5 | 60.7 |
比 IGPO 高 2.1 EM、1.3 F1。相对 Search-R1,四条多跳平均 +7.4 EM,三条单跳只有 +1.3,和「中间纠错能挡住后续检索」的动机一致。3B 上 CAFE 平均 EM/F1 到 48.8/57.4,超过 Search-R1-3B 的 42.7/51.9。答案级幻觉:基座 29.9%,GRPO 17.6%,CAFE 12.6%,NQ 上比 GRPO 再降 10.8 个百分点。
只更智能体或只更 critic 都会顶住。feedback-only 从 67.7 到 71.3,agent-only 冲到 84.2 再落到 83.6;交替更新到 86.6。第 3 到第 5 轮,智能体和同时期 critic 配对最好。这更接近「跟当前失败分布对齐」,不是 critic 单纯变强。
给正在训搜索智能体的人一个具体结论:终点奖励不够,事后反思也不够,要把纠正做成轨迹内可请求的动作,并且让写反馈的那一侧跟着策略一起更新。CFE 和 advantage shaping 解决的是信用分配,不是又堆一个提示模板。共享参数省掉单独 critic,两边也会互相污染,所以才需要 RDPO 这种相对目标,而不是把成功反馈再 SFT 一遍。
BrowseComp-Plus 上 CAFE 把 EM 从基座 4.4 推到 7.7,方向对,绝对值仍低。这套方法现在更像检索问答上的信用工程,还不是通用 deep research 解法。
论文没有单独的局限节。SFT 冷启动靠更强的 Kimi-K2.5 当老师,后面的共进化是在这份老师数据上长出来的,老师修了多少失败、数据规模多大,文中没给。IGPO 是在他们的 SFT 检查点上复现的,Search-R1 和 R-Search 用的是原文数字,协议不完全对齐。幻觉定义是「答案里有检索证据撑不住的事实主张」,参数知识答对也可能被算进去。BrowseComp-Plus 的 7.7 EM 说明长程浏览还远没被这套反馈打穿。只测了 Qwen2.5 的 3B 和 7B。