Harness 演化评测被高估了

UW · hf · 2026-07-18

这篇工作重新审视了 LLM agent 的 harness 自动演化 评测方式。

作者指出,现有方法通常用单元测试反馈去搜索 harness 配置,并在同一公开基准上报告最终成绩,这会带来两个问题:

作者在 Terminal-Bench 2.1 上,结合 GPT-5.4 和 Claude Opus 4.6 做了系统实验。结果显示:

结论是:需要更公平的评测协议和更合适的 benchmark,来判断自动 harness 设计到底带来了什么。代码已开源。

所属事件:Agent外壳自改与领域Harness之争(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →