AgentMercury 论证:训练环境异于评测集可提升 Agent 泛化力
rohanpaul_ai · x · 2026-08-28
AgentMercury 研究表明,Agent 的训练环境不应模仿评测集,而应基于商业场景构建。实验让 Agent 在与基准无关的模拟公司中训练,结果显示其在原基准上表现更佳。该方法生成了 4783 个模拟公司,每个拥有独立的服务、工具和数据库。此外,构建环境的过程本身也可学习:模型在微调后生成有效公司的成功率从 3.3% 提升至 83.3%,匹配 Claude Opus 4.8 水平。
「编程与Agent」频道最新
- Grok Bot 串联邮件、Intercom 与 Cursor:相当于多雇一名工程师 — minchoi · 2026-08-28
- Grok Bot 被称为口袋里的一人公司:10 个真实用例盘点 — minchoi · 2026-08-28
- 推测性工具调用: Agent 代码执行提速 2 倍的新思路 — CShorten30 · 2026-08-28
- Agent 开发是否陷入重复造轮子的平台税困境? — rio_ARC · 2026-08-28
- 开发者直播:现场构建数据流水线处理日志 — aronchick · 2026-08-28
- Claude 计算机使用能力实测:搞定填表 — HamelHusain · 2026-08-28