新方法 Agentic ESOpt:用进化策略微调长周期 Agent

yeewhye · x · 2026-08-20

论文提出了一种名为 Agentic ESOpt 的新框架,旨在解决长周期 LLM Agent 的微调难题。相比传统的强化学习(RL),该方法利用进化策略(ES)在参数空间进行优化。其优势在于:仅需推理级别的 GPU 内存即可实现全参数微调;支持提示词(prompt)与参数的协同进化;在长轨迹任务中能更好地进行归因,避免 RL 中棘手的信用分配问题。

所属事件:Agentic ESOpt 用进化策略低成本微调智能体(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →