新法通过事实效用估计实现搜索代理的密集过程监督
_reachsumit · x · 2026-09-02
论文《Dense Process Supervision for Search Agents via Fact Utility Estimation》提出了一种密集过程监督方法,解决了搜索代理强化学习中仅依赖结果奖励导致的信用分配困难问题。该方法将推理过程建模为离散证据事实的积累,首先从原始观测中提取结构化事实并组织成显式事实库;然后对语义等价的事实进行聚类,并通过贝叶斯估计推断每个事实簇的后验效用;最后将估计的事实效用转换为密集的步骤级奖励来指导 RL 训练。在七个 QA 基准上的实验表明,该方法持续优于现有基线。
「编程与Agent」频道最新
- 开发者厌倦频繁切换模型,更倾向稳定改进的 Claude Code — ivan_bezdomny · 2026-09-02
- Claude-BugHunter:83个技能+681个披露模式的开源漏洞猎手包 — tom_doerr · 2026-09-02
- 单提示词生成完整《模拟人生》级生活模拟器 — CurieuxExplorer · 2026-09-02
- 质疑过度验证:Coding Agent 的运行时状态问题 — klahmestiyo · 2026-09-02
- Nous Research 发布 Portal 平台整合 Agent 生态 — Teknium · 2026-09-02
- 用 Q-learning 训练 GDevelop 平台游戏 AI — tristanbob · 2026-09-02