HindSearch:利用黄金答案事后复盘,增强搜索智能体训练

_reachsumit · x · 2026-08-04

现有搜索增强语言模型智能体通常使用二元精确匹配奖励进行训练,忽略了失败轨迹的具体原因。HindSearch 提出了一种基于事后视角的自我蒸馏流程。

在每次 rollout 后,冻结的裁判模型会利用黄金答案对失败轨迹撰写简短批评,并以此为学生模型的搜索动作提供辅助的按策略蒸馏信号。在七个标准基准测试中,基于 Qwen2.5-3B-Instruct 的 HindSearch 达到了 39.4% 的平均 EM,优于先前的搜索强化学习基线。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →