Harness 演化评测被高估了
UW · hf · 2026-07-18
这篇工作重新审视了 LLM agent 的 harness 自动演化 评测方式。
作者指出,现有方法通常用单元测试反馈去搜索 harness 配置,并在同一公开基准上报告最终成绩,这会带来两个问题:
- 把 harness 改进和额外搜索混在一起:harness 演化本身也是一种迭代搜索,应和简单的任务级 test-time scaling / discovery baseline 在相同反馈与推理预算下公平比较。
- 可能对基准过拟合:搜索与最终评测使用同一批任务,提升可能只是记住了该任务集,而不是真正学到了可泛化的 harness 设计。
作者在 Terminal-Bench 2.1 上,结合 GPT-5.4 和 Claude Opus 4.6 做了系统实验。结果显示:
- 自动 harness 演化并不稳定优于简单的 test-time scaling 方法;
- 在留出任务上的泛化有限;
- 现有评测协议可能高估了自动 harness 设计的收益。
结论是:需要更公平的评测协议和更合适的 benchmark,来判断自动 harness 设计到底带来了什么。代码已开源。
所属事件:Agent外壳自改与领域Harness之争(6 条相关)→
「编程与Agent」频道最新
- 团队级 AI Agent 落地难题:共享上下文和任务协调放哪里? — Al_Grigor · 2026-09-11
- MCP 链式调用无回滚:agent 工程的真实痛点 — agentrsdg · 2026-09-11
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- 用 Agent 造小分类器:19 万文档标注成本仅 0.7 美元 — vanstriendaniel · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11