EnvACE:通过世界演练内化环境动态,突破智能体训练瓶颈

Zishan Xu · hf · 2026-08-07

训练大型语言模型(LLM)智能体进行长周期工具调用通常依赖昂贵的外部环境交互。为此,研究者提出了 EnvACE 方法,引入“世界演练(World Rehearsal)”机制来替代外部环境交互。

该方法的核心机制如下:

实验表明,EnvACE 在 BFCL-v4、tau^2-Bench 等多个基准测试中取得了强劲且可迁移的性能表现,超越了环境扩展基线。此外,在测试阶段,这种内化的世界模型允许模型在正式执行前进行“私下演练”,在适度预算下无需额外外部交互即可进一步提升效果。代码已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →