CAFE:让搜索Agent与评论家共演实现自改进
_reachsumit · x · 2026-08-26
针对结果监督的搜索 Agent 难以定位中间错误的问题,论文提出了 CAFE 框架。该框架使用一个共享参数的模型交替扮演搜索 Agent 和评论家角色,允许 Agent 在轨迹中途请求并使用纠正性反馈。通过在线 RL 和离线偏好优化的结合,CAFE 让 Agent 从自身的失败中学习反馈引导的恢复策略。在七个 Agent 搜索基准测试中,CAFE 的平均表现优于基于 RL 的搜索 Agent,并且在六个域外基准上保持了性能增益。
所属事件:腾讯混元提出 CAFE 框架:搜索 Agent 与评论家协同进化(2 条相关)→
「研究」频道最新
- LLM 如何在生成中途自我修正?揭秘背后的推理与指令机制 — dejanseo · 2026-08-26
- 智利大学出书探讨 Maturana 理论在 AI 领域的现时有效性 — PolarBearby · 2026-08-26
- ECCV 2026 新研究:Face Anything 实现任意序列 4D 人脸重建 — rsasaki0109 · 2026-08-26
- 日企将在 ECCV 2026 共办 FOUND 研讨会聚焦基盘数据 — HirokatuKataoka · 2026-08-26
- Gemini 3.7 Flash 助力复活 CMA-ES 算法解释网站 — doodlestein · 2026-08-26
- 从 PDE 数值模拟到神经模拟器及回归:博士论文 — chaumian · 2026-08-26