Harness-G:将搜索智能体检索重构为图上有限动作选择

_reachsumit · x · 2026-07-31

Harness-G 是一个针对强化学习(RL)搜索智能体设计的图结构框架。论文指出,当前主流的搜索智能体(如 Search-R1)在训练中常出现检索等价坍缩(retrieval-equivalence collapse)现象:模型针对同一问题不断生成不同查询词,但最终积累的证据集却高度重合,导致轨迹间缺乏有效的检索对比度。

为解决该问题,Harness-G 重新设计了策略与环境的交互接口,将自由文本的查询生成转化为图上的有限动作选择:模型直接选择证据句子、实体或决定输出答案,而由环境负责构建选项菜单、追踪检索状态并验证执行。此外,该框架还引入了结构化非短视信用分配机制,利用冻结的评分器来比较所选动作与其备选项,从而优化智能体的多步检索决策。

所属事件:Harness-G框架解决搜索智能体检索别名问题(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →