新方法 Agentic ESOpt:用进化策略微调长周期 Agent
yeewhye · x · 2026-08-20
论文提出了一种名为 Agentic ESOpt 的新框架,旨在解决长周期 LLM Agent 的微调难题。相比传统的强化学习(RL),该方法利用进化策略(ES)在参数空间进行优化。其优势在于:仅需推理级别的 GPU 内存即可实现全参数微调;支持提示词(prompt)与参数的协同进化;在长轨迹任务中能更好地进行归因,避免 RL 中棘手的信用分配问题。
所属事件:Agentic ESOpt 用进化策略低成本微调智能体(3 条相关)→
「编程与Agent」频道最新
- Grok Bot 大更新:接入 Google 全家桶,首响提速 13.5% — XFreeze · 2026-09-23
- 跑 12 小时的 AI agent,也扛不住客户在第 2 小时改需求 — HaktanSuren · 2026-09-23
- 毕业生开源 BehaviorLLM:用本地 LLM 驱动 Unity 游戏 NPC — faeliondev · 2026-09-23
- 同一像素动画编程题横评:仅一个模型全程无干预跑通 — hullabaloo22 · 2026-09-23
- 一张穿搭照自动全网比价,WearScout 用浏览器 agent 找同款 — HowDevelop · 2026-09-23
- 有人用 Claude Code+MCP 抓取 200 家 DTC 品牌 1000 条爆款广告做成素材库 — alexgoughcooper · 2026-09-23