AnySearch:单一策略适应任意预算的强化学习搜索框架
_reachsumit · x · 2026-09-02
论文《One Policy, Any Budget》提出了 AnySearch 框架,旨在解决现有 LLM 搜索代理在固定预算下训练、无法适应部署时约束变化的问题。该方法通过课程强化学习训练单一策略,使其能适应任意预算约束。训练分为两阶段:首先通过显式预算状态注入和结构化推理提示引导高效分配;随后移除脚手架,让代理在自适应采样的预算约束下自主运行。实验表明,该方法在七个 QA 基准测试中优于基线,能泛化至训练范围外的约束,并实现优越的工具生产力。
「编程与Agent」频道最新
- 开发者厌倦频繁切换模型,更倾向稳定改进的 Claude Code — ivan_bezdomny · 2026-09-02
- Claude-BugHunter:83个技能+681个披露模式的开源漏洞猎手包 — tom_doerr · 2026-09-02
- 单提示词生成完整《模拟人生》级生活模拟器 — CurieuxExplorer · 2026-09-02
- 质疑过度验证:Coding Agent 的运行时状态问题 — klahmestiyo · 2026-09-02
- Nous Research 发布 Portal 平台整合 Agent 生态 — Teknium · 2026-09-02
- 用 Q-learning 训练 GDevelop 平台游戏 AI — tristanbob · 2026-09-02