AgentMercury 论证:训练环境异于评测集可提升 Agent 泛化力

rohanpaul_ai · x · 2026-08-28

AgentMercury 研究表明,Agent 的训练环境不应模仿评测集,而应基于商业场景构建。实验让 Agent 在与基准无关的模拟公司中训练,结果显示其在原基准上表现更佳。该方法生成了 4783 个模拟公司,每个拥有独立的服务、工具和数据库。此外,构建环境的过程本身也可学习:模型在微调后生成有效公司的成功率从 3.3% 提升至 83.3%,匹配 Claude Opus 4.8 水平。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →