HindSearch:利用黄金答案事后复盘,增强搜索智能体训练
_reachsumit · x · 2026-08-04
现有搜索增强语言模型智能体通常使用二元精确匹配奖励进行训练,忽略了失败轨迹的具体原因。HindSearch 提出了一种基于事后视角的自我蒸馏流程。
在每次 rollout 后,冻结的裁判模型会利用黄金答案对失败轨迹撰写简短批评,并以此为学生模型的搜索动作提供辅助的按策略蒸馏信号。在七个标准基准测试中,基于 Qwen2.5-3B-Instruct 的 HindSearch 达到了 39.4% 的平均 EM,优于先前的搜索强化学习基线。
「编程与Agent」频道最新
- 破解长程任务智能体状态迷失,新框架让准确率大幅提升 — Ziyu Ma · 2026-08-04
- 告别 Docker:db-here 实现 AI 智能体零风险隔离数据库 — andersonbcdefg · 2026-08-04
- memsem:为 AI Agent 打造的本地化语义记忆 MCP 服务器 — WindSeries · 2026-08-04
- OpenAI 推出 ChatGPT Work,可数小时自主完成复杂项目 — emmanuelvivier · 2026-08-04
- Google Gemini API 推出托管 Agent 服务 — emmanuelvivier · 2026-08-04
- Token 价格暴跌为何没省下钱?开发者呼吁关注「单步完成成本」 — truecakesnake · 2026-08-04