EvoHarnessBench:给 Agent 不断加工具,反而可能让它变差
mohitban47 · x · 2026-09-11
Shafiq Joty 团队发布 EvoHarnessBench,研究一个反直觉问题:我们总在给 agentic 系统不断添加工具、skills 和专家 agent,每次添加看似是升级,但不断演化的 harness(执行框架)会不会让 agent 在原本能解决的任务上变差?
核心发现:
- 答案是肯定的——harness 的演化可能损害 agent 原有的任务能力
- 更意外的是,即便是现有的 self-evolving(自进化)方法,也无法在适应新能力的同时可靠地保留既有能力
该基准用于检验 agent 能否跟上演化中的 harness。
「编程与Agent」频道最新
- LangChain 90 秒讲透 Agent Harness:不做模型,就在做 harness — LangChain · 2026-09-12
- Fable 5.1 演示自主入职:agent 从反馈中沉淀可复用技能 — ysu_nlp · 2026-09-12
- 开源桌面应用 Vyact:围绕本地 LLM 打造可审查的工作流 — vyact · 2026-09-12
- Runway 推出 MCP 服务,可直接在 ChatGPT 和 Claude 里生成图像视频 — runwayml · 2026-09-12
- 新版模型下 token 压缩工具还有用吗?RTK 成本实测揭晓 — Bartaseth · 2026-09-12
- Warp 终端 remote-control 搭配 Grok 实测:终端画面直接流式上网页 — Daniel_Farinax · 2026-09-12