EnvACE:通过世界演练内化环境动态,突破智能体训练瓶颈
Zishan Xu · hf · 2026-08-07
训练大型语言模型(LLM)智能体进行长周期工具调用通常依赖昂贵的外部环境交互。为此,研究者提出了 EnvACE 方法,引入“世界演练(World Rehearsal)”机制来替代外部环境交互。
该方法的核心机制如下:
- 角色交替:策略模型先生成一个工具调用动作,随后扮演“环境”生成该动作的响应,并基于此模拟响应进行后续决策。
- 端到端优化:动作与环境这两个角色通过任务成功奖励进行联合优化,使模型在参数中内化动作与环境响应的关系,形成支持决策的“智能体世界模型”。
实验表明,EnvACE 在 BFCL-v4、tau^2-Bench 等多个基准测试中取得了强劲且可迁移的性能表现,超越了环境扩展基线。此外,在测试阶段,这种内化的世界模型允许模型在正式执行前进行“私下演练”,在适度预算下无需额外外部交互即可进一步提升效果。代码已开源。
「编程与Agent」频道最新
- 开源本地 MCP 代理 ShadowPaste:保护 .env 密钥免遭 AI 窥探 — shadowpaste · 2026-08-07
- 痛点吐槽:现在的 AI Agent 连找个好航班并订票都做不好 — braelyn_ai · 2026-08-07
- GitHub项目为Claude Code等助手提供24个跨平台技能 — tom_doerr · 2026-08-07
- LangChain开源OpenWiki:为代码库自动生成Agent文档 — lxfater · 2026-08-07
- AI 编程时代,终端交互该进化了:从纯文本到结构化语义 — Ok_Path_4731 · 2026-08-07
- Claude Code 新增自托管 Runner,支持 Web 端调用本地算力 — ClaudeCodeLog · 2026-08-07