Salesforce 发布 EvoHarnessBench:考验 Agent 应对工具与环境持续演进

Salesforce · hf · 2026-09-10

Salesforce 在 Hugging Face 发布 EvoHarnessBench,这是一个评估 LLM agent 在工具、技能和 agent harness(运行框架)持续演进条件下表现的基准。研究发现 agent 普遍存在三类持续存在的短板:对旧工具/技能的保留(retention)不足、对新 harness 的适应(adaptation)困难,以及「harness 引发的遗忘」——即运行框架的变化本身会导致 agent 已有能力退化。该基准直接指向 agent 工程里一个此前少有系统评测的问题:真实生产环境中 harness 并非静态,工具与框架会不断升级。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →