三星提出 PROGRESS 框架:用覆盖引导强化学习优化 RAG 智能体
_reachsumit · x · 2026-08-04
三星研究团队提出了一种名为 PROGRESS 的覆盖引导强化学习(RL)框架,旨在解决现有搜索增强 LLM 智能体仅依赖结果奖励、缺乏对搜索行为监督的问题。
- 核心机制:在 R1 风格的训练中引入冻结的“教师模型”,将复杂查询分解为关键的子搜索查询,以此作为策略模型的覆盖奖励,提供轻量级的查询分解指导。
- 实验结论:该方法无需密集的监督即可有效改善智能体的搜索策略分解能力,显著提升了整体任务表现,证明了显式监督搜索策略对智能体 LLM 的重要性。
「编程与Agent」频道最新
- 破解长程任务智能体状态迷失,新框架让准确率大幅提升 — Ziyu Ma · 2026-08-04
- 告别 Docker:db-here 实现 AI 智能体零风险隔离数据库 — andersonbcdefg · 2026-08-04
- memsem:为 AI Agent 打造的本地化语义记忆 MCP 服务器 — WindSeries · 2026-08-04
- OpenAI 推出 ChatGPT Work,可数小时自主完成复杂项目 — emmanuelvivier · 2026-08-04
- Google Gemini API 推出托管 Agent 服务 — emmanuelvivier · 2026-08-04
- Token 价格暴跌为何没省下钱?开发者呼吁关注「单步完成成本」 — truecakesnake · 2026-08-04