BRIDGE 双层强化学习联合训练搜索 Agent 的 LLM 与检索器,多跳问答提升 9.6 EM
_reachsumit · x · 2026-09-30
arXiv 新论文提出 BRIDGE,一种面向智能体强化学习(ARL)的检索信用感知双层优化方法。
- 动机:现有 ARL 方法只优化 LLM 生成的 token,把检索结果当作环境观测,导致「信息信用错配」——因检索证据缺失或误导造成的失败被错误归因给 LLM 而非检索器。
- 关键发现:检索器与 LLM 策略的学习顺序敏感:先适配检索器再优化策略,奖励增益更大。
- 方法:将检索增强的 agentic RL 建模为双层优化问题,基于 RL 与检索目标的损失景观分析,提出内存高效的一阶双层算法,先训练检索器、后联合适配 LLM。
- 结果:在 7 个开放域 QA 基准上,3B 与 7B 骨干均取得最高平均准确率,多跳 QA 相比最强基线分别提升 9.6 和 3.4 EM;在医疗 QA 上平均答案准确率与推理质量也最佳。代码已开源。
「编程与Agent」频道最新
- 用 Grok 搭「X 编辑部」自动化选题写帖,每天省下 3 小时 — jamestagg · 2026-09-30
- 知名 iOS 开发者盛赞 Codex 云端环境:配合 dots 体验极佳 — Dimillian · 2026-09-30
- Agent 谎报「CRM 已更新」:实战者总结模型外验证方案 — Kindly_Ganache9027 · 2026-09-30
- 开源 Agent 框架 Omnigent v0.16.0:沙盒写时复制与统一工作区浏览器 — matei_zaharia · 2026-09-30
- Midas Touch 代码数据集遭质询:可复现性与数据泄漏存疑 — maier_ak · 2026-09-30
- Midas Touch:直接从源码扩展 AI 编码环境的新论文 — maier_ak · 2026-09-30