Search-G1:基于表征内在奖励的搜索智能体训练框架

_reachsumit · x · 2026-08-11

现有的搜索增强型语言智能体常面临奖励信号的两难:外部结果奖励过于稀疏,而丰富的过程反馈又需要昂贵的标注。内部奖励(如熵或信息增益)虽然成本低,但主要反映模型自信度而非对证据的依赖。

为此,论文提出了 Search-G1,一个基于表征的内在奖励框架。它通过两个干预校准的读数来衡量智能体回答的实际依据:

该机制在检索必要且对证据敏感时,为正确的搜索轨迹提供额外信用;在闭卷知识充足时,奖励直接回答;并惩罚重复搜索。这种方法有效提升了搜索智能体的证据基础和效率。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →