EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness?
Zixuan Ke, Vaidehi Patil, Haizhou Shi, Yang Li, Ye Liu, Sarath Shekkizhar, Anurag Koul, Jiayu Wang, Xuan Phi Nguyen, Semih Yavuz, Mohit Bansal, Shafiq Joty
cs.MA, cs.CL
2026-09-03
Salesforce 把 802 个任务拆成 17 条逐步变大的工具、技能、专家流。光是 harness 膨胀就会让已解任务掉分,专家轴最重跌 34.7%;保住旧能力和适应新能力经常反向。
现在的 LLM Agent 不是一个模型和一句 prompt。它被套在 harness 里:能调的工具、可检索的技能说明书、可委派的专家 Agent。Salesforce 的 Agentforce 目录和 OpenAI 的 skills 仓库都在持续加能力。现有评测几乎都把 harness 钉死,把非平稳性放在任务流上,或者只看 Agent 自己长出来的技能。生产里变的是外部给它的那套能力表面。
harness 一变,出现两件独立的事。保留:旧任务所需能力还在,但被埋进更大的目录里,以前能走通的行为变难找。适应:系统若会把记忆、技能、prompt 跨阶段留下来,这些产物可能过时,甚至把执行拽回旧 harness 上有效、现在不合适的路径。
EvoHarnessBench 不造新题,把 EnterpriseOps-Gym 和 Agentic Last Exam 两套带校验器的静态基准,按工具、技能、专家三条轴拆成 17 条嵌套流,每条 3 到 6 个阶段,共 70 个快照。802 个原任务实例化成 1510 条轴上评测样本,覆盖 520 个可执行工具、42 个潜伏参考技能、62 个专家 Agent。
能力按任务频率分桶释放:高频核心先上,长尾后上。阶段 t 的 harness 是到 t 为止的并集,只增不减。每道题被分到「全部所需能力刚齐、且至少用到一个新能力」的最早阶段。评测时系统拿到的是累计全集,不是按题裁剪的 oracle 子集。终局阶段里,每道题平均面对 89.0% 的干扰工具或 76.8% 的干扰专家。技能轴上,源 prompt 里的步骤被规则抽成可检索技能,再按校验器状态关键词对齐;这是启发式,不保证必要或充分。专家轴按工具操作的实体捆成专家,85.2% 的题需要跨多个专家协调。
两种协议。部署评测:阶段之间不留状态,隔离「目录变大」本身。自我进化适应评测:允许记忆(Raw Memory、ReasoningBank、MemToolAgent、G-Memory、LEGOMem)、prompt 进化(GEPA)、代码级 harness 优化(Meta-Harness)跨阶段积累。底层模型固定,不更新权重。指标是通过率,外加相对前向迁移 FWT(新阶段题)和后向迁移 BWT(旧题在新 harness 上)。对照条件是每题只暴露标注所需能力的 task-specific 参考。
评测系统包括 ReAct(GPT-5)、Codex、Claude Code(Sonnet-4.6,因模型和 harness 不同,主表未并入)、AutoGen 和 DeLM。
三条轴的机制不一样。
工具轴。把完整累计目录交给前沿系统,总通过率从 task-specific 的 24.2% 升到 28.1%,但代价很明显:EOG 上 ReAct 的 token 从 2720 万涨到 7580 万。MemToolAgent 把 EOG 通过率从部署基线 30.2% 拉到 38.6%,ReasoningBank 36.9%,Meta-Harness 35.2%。ALE 上多数适应方法贴着基线或更差。部署 BWT 为负,工具轴最大遗忘 5.3%。GEPA 和 Meta-Harness 能把 BWT 做成正,但在 ALE 上 FWT 掉到 -28.5% 和 -11.1%。
技能轴。目录变大几乎不改部署成绩:Codex 在 EOG 上 task-specific 和累计都是 18.9%。GEPA 把 EOG 通过率提到 24.1%。默认 GPT-5 在终局几乎不调用提供的技能;task-specific 的 GPT-5.5 调用率 82%,Claude Code 15%,task-specific GEPA 能把 GPT-5 拉到 31%。技能轴最大遗忘 4.0%,比工具轻。
专家轴。绝对水平最低。Codex 在 EOG 从 6.5% 升到 8.8%,在 ALE 从 5.3% 掉到 4.2%。Meta-Harness 在 EOG 做到 18.5%,相对部署基线提升 110.2%。ALE 上 Codex 部署 BWT 为 -34.7%,三条轴里最重。委派精确率各方法都在 90% 附近,所需专家召回从无适应的 79% 升到最高 89%。被忘掉的旧题,委派集合漂移从 13% 升到 25%,主要是不再叫以前叫过的专家,不是被新来的无关专家抢走。
Agent 产品每周都在往目录里塞工具和子 Agent。这篇把目录膨胀从运维噪声变成可测的评测轴。结论对做 Agent 平台的人很具体:保留和适应要分开报,不能只看终局通过率;工具轴要会从宽搜索空间里抽有用经验,技能轴先得让模型真去调技能,专家轴要稳住曾经有效的委派覆盖。适应时给工具和技能用题相关的窄暴露更省、有时更好;专家适应反而受益于从头就稳定的完整池。
这是渐进但方向正确的评测工作,不是新算法。
能力只增不减,没有替换和下线,而真实仓库两者都有。技能-任务对齐靠关键词,论文自己写了不保证必要或充分。通过率绝对值偏低,尤其专家轴个位数,天花板可能卡在源基准难度和多 Agent 协调,不完全是 harness 演化。部分 MAS 实验因算力没跑完。Claude Code 因底层模型和 harness 不同被移出主表。频率分桶释放只是对真实发布顺序的定性模仿。适应方法都不改模型权重,测的是 harness 层记忆,不是持续学习意义上的参数更新。FWT 和 BWT 在部分域上还标了域间不一致。