EnvACE:让策略既当 agent 又当环境,摆脱外部环境做强化学习

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

cs.AI

2026-08-06

训练时让同一策略自己生成每个动作的环境响应并据此决策,内化出 agent 世界模型;4 个 agent 基准综合分超过环境扩展基线,测试时还能私下预演候选动作再择优执行。

这篇在解决什么

训练一个会用工具的 LLM agent,主流做法是让它在与真实或合成「可执行环境」的交互中学习:每发出一次工具调用,环境就返回一个观测(工具输出、用户反馈),策略据此继续。问题在于,这些环境要么构建和验证成本高,要么得靠外部 LLM 模拟器生成响应,而模拟器既可能不准、又仍需真实环境来校准。结果是 agent 训练的规模始终被「外部环境供给」卡着脖子,而对「环境会怎么响应它的动作」的建模能力,一直留在策略之外。

EnvACE 的出发点是:一个够好的 agent 策略,不该只会动作,还该能预测动作会换来什么环境反馈。

方法

EnvACE 让同一个策略同时承担两个角色。每个回合,「演员」角色先生成一个对外的动作(工具调用);接着「预演」角色基于历史和这个动作,生成环境本该返回的响应。这个自生成的响应被追加进交互历史,演员再据此做下一步决策。整条轨迹由策略自己展开,不再查询任何外部环境。两个角色反复交替,「动作会换来什么响应」这层关系就被吸进策略参数里,形成一个可直接用于决策的 agent 世界模型。

优化用 GRPO 的一个变体,叫「分角色 GRPO」:对同一条指令采样一组轨迹,演员和预演各自的输出分别在自己的角色内算基线,advantage 相对各自基线计算,但两个角色共享同一套参数、联合更新。这保证预演学到的环境知识能直接流回演员。

测试时,这个内化的世界模型还能派上用场:策略对同一任务私下预演若干套候选动作(并行,或顺序模式能看到上一轮的预演和自我评估),把结果汇总成一段「预演记忆」,再在真实环境里执行一次最有把握的动作。预演过程不改动外部环境。

结果

主实验在 BFCL-v4、τ²-Bench、VitaBench 三个基准上,EnvACE-8B(基于 Qwen3-8B)综合分 32.91%,超过所有环境扩展基线,比 EnvScaler-8B 高 0.99 个百分点、比 AWM-14B 高 0.37。τ²-Bench 平均 36.7%(次高),VitaBench 16.0%(7B 到 8B 档最高)。在金融 MCP 基准 FinMCP-Bench 上,TF1 达 46.78%、工具精度 54.04%,均为最高。

对照实验更能说明机制。在 8B 上,相比标准 GRPO,world rehearsal 把 τ²-Bench 从 31.2% 拉到 36.7%,涨 5.5 个百分点。把两个角色拆给两套独立策略(Per-role Policy),τ²-Bench 只有 35.5%;参数共享带来 +1.2,说明环境知识确实流回了演员。从 1.7B 扩到 8B,BFCL-v4 涨 14.23 个百分点、τ²-Bench 涨 21.4,world rehearsal 随规模放大收益更大。

测试时预演:不做预演综合分 36.7%,用 EnvACE 并行预演两轮升到 40.9%,涨 4.2 个百分点。关键对照是,改用基础模型来预演几乎没收益,说明涨点不来自多花算力,而来自训练中内化的世界模型。预演轮数 N=2 最优,N=3 反而回落,作者归因于输入变长逼近上下文上限。

为什么重要

agent 训练长期被「环境供给」锁死:要么造昂贵的可执行环境,要么依赖外部模拟器。EnvACE 给出第三条路,把环境建模搬进策略自己,训练时不需要外部环境参与,测试时还能用它做廉价预演。对做工具型 agent 的人来说,这意味着训练数据瓶颈可能被绕开,代价是引入一个新假设:策略自己演的环境够准。

局限与存疑

作者承认两点:只验证到 8B 规模,更大模型是否仍受益未知;评测集中在工具交互任务,更广的 agent 场景没覆盖。读下来还有一个疑点:预演响应完全由策略自己生成,长链条任务里误差会逐步累积。论文用任务成功奖励端到端约束,但没有单独报告预演响应与真实环境响应的一致性,内化世界模型到底多准仍是黑箱。测试时预演在 N=3 回落,也暗示上下文长度会成为这条路线放大的硬约束。

术语

原文与代码

相关论文

全部论文解读