Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents
Ran Yan, Wei Fu, Jiale Li, Shusheng Xu, Zhiyu Mei, Jiaxuan Gao, Jiarui Zhang, Wentai Zhang, Hao Dai, Xujie Shen, Chuyi He, Zhen Pu, Jun Mei, Zhiyao Lin, Haitao Wang, Zhiqiang Ding, Jiawei Zhang, Huaijie Wang, Ruida Xu, Honghua Dong, Youhe Jiang, Yi Wu, Tongkai Yang, Binhang Yuan
cs.DC
2026-07-02
立场文章:企业级自我进化 Agent 的瓶颈是 RL 系统底座而非算法。作者拆出轨迹数据协议、企业数据代理、进化控制面三支柱,并用 AReaL2.0 落地其中策略权重在线更新这一环。
企业里部署的 LLM Agent(代码助手、客服、科研助手)在上线那一刻就是静态的:模型权重、系统提示、工具集、上下文框架(harness)都冻在部署时。要让它变好,得走一整套人工循环:收集数据、离线微调、改 Agent 范式、重新部署。一个面向成千上万用户的 Agent 每天产生海量工具调用轨迹,这些经验几乎没被用于自我改进。
个人级的自我进化 Agent 已经出现,论文反复引用 OpenClaw 这类能在单个用户交互里持续学习的产品。但把这件事搬到企业规模(多团队、多租户、多合规边界),真正缺的是一整套把线上交互轨迹转成「可治理、可归因、可回放」训练素材的系统底座,更大的模型、更巧的提示、甚至更好的 RL 算法都补不上这个缺口。这是蚂蚁集团、清华、港科大 AReaL 团队的立场文章,核心判断是:自我进化 Agent 不只是算法命题,更是系统命题。
论文给出三根共同设计的支柱,每根对应一个空缺。
第一,Agent 轨迹数据协议(ATDP)。 现有的 Agent 日志记的是提示、补全、工具调用、延迟、报错、token 用量,够调试但不够训练。ATDP 把一条轨迹定义成有类型的事件序列 τ=(e1, e2, …, eT),每个事件 et=⟨ot, ht, at, yt, rt, mt⟩:可观测状态(工具返回、检索片段、用户消息)、隐藏内部状态(计划、草稿、置信度)、所选动作(工具调用、生成的 token、代码改动、记忆更新)、动作结果、奖励信号、以及元数据(延迟、token、成本、租户、模型版本、harness 指纹)。把 ht 和 mt 去掉就是标准 POMDP,留得住则能承载 LLM 特有的东西:推理链、检索片段、工具 schema、人工纠正、自然语言批评。两个设计点最关键:延迟到达的奖励(下一轮的用户纠正、失败的测试、迟到的人工标注)要能事后补写进奖励字段而不破坏原始因果记录;每个事件都要带版本化来源(harness、工具版本、检索索引快照、模型 checkpoint),否则轨迹「统计上有用、操作上不可复现」。
第二,企业级数据代理(data proxy)。 ATDP 规定记什么,数据代理规定怎么在生产里抓到。企业的 Agent 不会都跑在同一个框架上(LangChain、CrewAI、OpenAI Agents SDK、Claude Agent SDK、MCP 工具、自研编排),所以代理必须在稳定的执行边界上拦截:模型 API 调用、工具调用、检索、记忆读写、文件或浏览器动作、人工审批、最终反馈。它不只是导出 trace,还要把生产流量变成受治理的学习素材:脱敏、访问控制、留存策略、训练资格校验都在数据进队列之前完成,不是「先攒日志、后补合规」。区分能力是回放:监控 trace 只能说「Agent 调了工具 X 失败了」,训练代理必须能回答「换个提示、模型、记忆、检索策略或工具 schema,Agent 会不会成功」。
第三,Agent 进化控制面(control plane)。 核心判断是自我进化不等于改权重。一个部署中的 Agent 是个复合策略 At=⟨πθ, Hψ, M, T, G⟩(策略 LLM、上下文框架、记忆、工具集、治理配置),不同故障要换不同的干预面:反复缺事实就插记忆,工具路由出错就改框架或 schema,可复用的流程性失败就打技能补丁,跨租户、跨任务、跨工具配置都复现的同类失败才动权重。控制面把这件事当成一个受治理的决策问题,在一窗轨迹上算 u=argmax JA(u | At, Dt),动作集包括权重更新、框架编辑、记忆更新、工具 schema 改动、回滚、以及 no-op。触发依据是轨迹统计(评估分、用户纠正率、过程奖励估计、工具失败聚类、金丝雀差值、单位成功成本、负载漂移),不是人工看两眼。每次干预都要过回放优先评估、离线回归、租户感知安全检查、版本化回滚。
这是一篇立场文章,没有 benchmark 数字,没有吞吐或延迟测量。三根支柱是论证出来的,不是测出来的:控制面的自动触发在真实大规模下能否把「该改记忆还是该改权重」判准、ATDP 能否被异构栈普遍采纳,论文都没给答案。
唯一的落地物是 AReaL2.0,而且只实现了三支柱里的一个分支:策略权重的在线更新。做法是把已有的离线 RL 框架 AReaL 改造成面向 Agent 服务的在线 RL 环,四个组件分工:Gateway 对外暴露成可替换的推理后端,Agent 把原来打 SGLang/vLLM 的 LLM 调用改成打它;Router 给多个在线 RL 任务做会话亲和管理;Data Proxy 记录轨迹、备好训练数据;Agent-Compute Worker 把 SGLang/vLLM 这类 rollout 引擎和 Megatron/FSDP 训练 worker 包成微服务,按轨迹流和训练需求动态调度算力。
验证用的是 Nous Research 的 Hermes Agent:原来 Hermes 调 SGLang 拿模型回复,换成 AReaL2.0 管理的 worker 后,Agent 服务本身几乎不用改,交互轨迹被截获、记录、喂进在线 RL 训练环。卖点是不用再另搭一个去模仿生产行为的 RL 环境,Agent 自己的原生工作流就是训练数据来源。
对做 Agent 平台和 post-training infra 的人,直接价值是这篇把「线上 Agent 流量到训练数据」这条管线从设想具体化成了一套可拼的组件,而且尽量复用现有推理和训练栈,改动面压在「换推理后端」这一处。这跟当前「用合成环境离线训练 Agent、上线后还是静态」的主流做法是两条路。
更大的价值在判断本身:如果认同企业级自我进化的瓶颈在系统,那该投的方向是轨迹协议、数据治理、回放能力、自动干预决策这些基础设施,不是再发明一个 RL 算法。对架构师和采购方,这是一条选型时可操作的核对线。
也得说清范围:这是渐进式的系统主张,不是能力跃迁。它不提供新模型、不带来新 benchmark 纪录,价值取决于这套底座能不能真被多团队采用、能不能压住合规成本。
作者自己把范围说得很小:AReaL2.0 只做了权重更新这一环,记忆插入、技能补丁、框架编辑、工具 schema 进化、回放治理、自动干预选择全部留给未来;ATDP 还停留在「原型形式化」阶段,没有给出跨异构框架的真实落地数据;数据代理的多租户隔离、联邦训练也只是设计原则,没实测。
另有几处站不住或没经验证。第一,整个论证依赖「线上轨迹是比合成或离线数据更好的训练来源」这个前提,但论文没有给线上数据与离线数据在下游效果上的对照,前提本身没被证实。第二,控制面的自动触发依赖一长串统计量(过程奖励估计、漂移指标、单位成功成本),这些信号在企业环境里的噪声和延迟完全没讨论,「自动决策」很可能退化成「把人工判断挪进一张阈值表」。第三,把脱敏、合规、训练资格校验塞进数据进队列之前的 hot path,对延迟和吞吐的影响只字未提,而这在真实生产里往往才是真正的拦路虎。