CAFE:让搜索Agent与评论家共演实现自改进

_reachsumit · x · 2026-08-26

针对结果监督的搜索 Agent 难以定位中间错误的问题,论文提出了 CAFE 框架。该框架使用一个共享参数的模型交替扮演搜索 Agent 和评论家角色,允许 Agent 在轨迹中途请求并使用纠正性反馈。通过在线 RL 和离线偏好优化的结合,CAFE 让 Agent 从自身的失败中学习反馈引导的恢复策略。在七个 Agent 搜索基准测试中,CAFE 的平均表现优于基于 RL 的搜索 Agent,并且在六个域外基准上保持了性能增益。

所属事件:腾讯混元提出 CAFE 框架:搜索 Agent 与评论家协同进化(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →