Agentic ESOpt 用进化策略低成本微调长视界智能体

新框架 Agentic ESOpt 针对长视界 LLM 智能体训练中 GPU 显存成本高昂的问题,采用进化策略替代传统反向传播,结合轨迹级奖励加权和参数-上下文协同进化,实现可扩展的全参数微调。该方案仅需推理级别的内存占用,在极低 GPU 需求下即可优化长视界智能体,显著降低了训练门槛。

2026-08-19 ~ 2026-08-20 · 2 条相关