Agentic ESOpt 用进化策略低成本微调长视界智能体
新框架 Agentic ESOpt 针对长视界 LLM 智能体训练中 GPU 显存成本高昂的问题,采用进化策略替代传统反向传播,结合轨迹级奖励加权和参数-上下文协同进化,实现可扩展的全参数微调。该方案仅需推理级别的内存占用,在极低 GPU 需求下即可优化长视界智能体,显著降低了训练门槛。
2026-08-19 ~ 2026-08-20 · 2 条相关
- Agentic ESOpt:低资源微调长视界 LLM Agent — NationalUniversityofSingapore · 2026-08-19
- Agentic ESOpt:仅需推理内存微调长视界LLM智能体 — _akhaliq · 2026-08-20