自进化Agent评测框架SEAGym

机器之心 · wechat · 2026-07-15

翁荔发布长文,系统讨论了 harness engineering 在 AI 自我改进中的作用。文章认为,原始模型与真实世界任务之间的 harness 层,正变得和模型本身一样重要;prompt、memory、tools、workflow、middleware、权限控制与运行时状态,共同构成了 agent 的可优化对象。 围绕“自进化 Agent 应该如何评测”,清华团队提出 SEAGym:一个面向 self-evolving LLM agents 的评测环境。它把 Agent 的基础模型与可更新 harness 状态分离,并通过统一的 rollout/update 接口接入不同自进化方法,如 ACE、TF-GRPO、AHE 等。评测不只看最终得分,还区分了 train batch、update-validation、ID transfer、OOD transfer、replay 和 cost 记录,能观察更新是否真的泛化、是否遗忘旧能力、是否引入更高成本或运行时不稳定。 文章给出的实验结论包括: - 只看 validation 分数会高估泛化能力,TF-GRPO 在验证集上涨但 OOD 反而下降。 - 自进化过程可能出现中间崩溃,最终分数掩盖不了某些 snapshot 的严重退化。 - batch size 对 harness 更新稳定性有明显非单调影响,并非越大越好。 - 不同 backend 学到的 harness 具有明显依赖性,跨模型迁移并不总是稳健。 整体上,这是一套把“Agent 会自己改自己”这件事变成可测、可回放、可诊断的基础设施方案。

所属事件:构建可靠AI Agent的核心在于工程编排(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →