Search-G1:基于表征内在奖励的搜索智能体训练框架
_reachsumit · x · 2026-08-11
现有的搜索增强型语言智能体常面临奖励信号的两难:外部结果奖励过于稀疏,而丰富的过程反馈又需要昂贵的标注。内部奖励(如熵或信息增益)虽然成本低,但主要反映模型自信度而非对证据的依赖。
为此,论文提出了 Search-G1,一个基于表征的内在奖励框架。它通过两个干预校准的读数来衡量智能体回答的实际依据:
- Prompt-state readout:预测闭卷能力是否充足,以此定义策略相关的检索必要性。
- Answer-commit readout:通过观察删除证据后回答阶段的敏感度,来估计对证据的依赖程度。
该机制在检索必要且对证据敏感时,为正确的搜索轨迹提供额外信用;在闭卷知识充足时,奖励直接回答;并惩罚重复搜索。这种方法有效提升了搜索智能体的证据基础和效率。
「编程与Agent」频道最新
- DeepSearcher开源:结合o3与向量库,实现私有数据深度推理 — tom_doerr · 2026-08-11
- 用Whop CLI不到30分钟开美甲店:AI工具包搞定建站与支付 — eptwts · 2026-08-11
- VS Code 插件商店现恶意扩展,提权后释放 XWorm 病毒 — cyb3rops · 2026-08-11
- 曝 DeepSeek 即将发布 Agent,已注册 Harness 官方账号 — op7418 · 2026-08-11
- RAG Me Up:面向工程实践的开源RAG全景教程 — FutureClubNL · 2026-08-11
- Anthropic高管推崇的“循环工程”被指是新瓶装旧酒 — thor123321 · 2026-08-11