新法通过事实效用估计实现搜索代理的密集过程监督

_reachsumit · x · 2026-09-02

论文《Dense Process Supervision for Search Agents via Fact Utility Estimation》提出了一种密集过程监督方法,解决了搜索代理强化学习中仅依赖结果奖励导致的信用分配困难问题。该方法将推理过程建模为离散证据事实的积累,首先从原始观测中提取结构化事实并组织成显式事实库;然后对语义等价的事实进行聚类,并通过贝叶斯估计推断每个事实簇的后验效用;最后将估计的事实效用转换为密集的步骤级奖励来指导 RL 训练。在七个 QA 基准上的实验表明,该方法持续优于现有基线。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →