AnySearch:单一策略适应任意预算的强化学习搜索框架

_reachsumit · x · 2026-09-02

论文《One Policy, Any Budget》提出了 AnySearch 框架,旨在解决现有 LLM 搜索代理在固定预算下训练、无法适应部署时约束变化的问题。该方法通过课程强化学习训练单一策略,使其能适应任意预算约束。训练分为两阶段:首先通过显式预算状态注入和结构化推理提示引导高效分配;随后移除脚手架,让代理在自适应采样的预算约束下自主运行。实验表明,该方法在七个 QA 基准测试中优于基线,能泛化至训练范围外的约束,并实现优越的工具生产力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →