Scale AI 基准 HarnessOpt:优化 agent 时换模型比换脚手架管用,自家工具也没占便宜

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

cs.AI, cs.CL, cs.LG

2026-08-07

Scale AI 的 HarnessOpt-Bench 让 5 个前沿大模型在固定预算下迭代优化 agent 的 harness(提示、工具、控制流等),111 次评测发现换优化模型带来的增益差距是换代码脚手架的约 1.8 倍,各家自带工具并无稳定优势。

这篇在解决什么

一个 agent 的本事不只看模型权重,还看裹在它外面的 harness,也就是提示、工具、控制流、记忆、编排代码。同样一个模型,套不同的 harness 能力差很多。于是「让 AI 自动把 harness 迭代改好」成了一项既重要、又很考模型的能力。问题是各家方法各用各的 agent、种子、预算、打分,没法横比。Scale AI 要做的,是把这件事变成一个可控、可复现的基准。

方法

基准的设定很讲究防作弊。一个 optimizer(一个大模型配一套代码脚手架)拿到目标 agent 的种子 harness、带评分的开发和验证反馈,以及一个固定的目标评测预算。它改 harness、提名最终候选,而最终打分用的是它在搜索全程都看不到的留出测试集。一个可信执行环境强制预算、挡住留出数据、给每个候选版本存档审计。任务覆盖 4 个下游(OfficeQA、BrowseComp-Plus、Terminal-Bench、GAIA),5 个前沿模型(claude-opus-5、claude-sonnet-5、gpt-5.6-sol、gpt-5.6-terra、kimi-k3),每个模型配两套脚手架:一套所有人共用的 opencode,一套自家原生的(claude-code/codex/kimi-cli),共 111 次有效评测。

结果

最强的 opus-5 配 opencode 在 OfficeQA 拿下 0.63 的归一化增益,大致吃下三分之二的改进空间;最弱的 gpt-5.6-terra 配 codex 在 BrowseComp 和 Terminal-Bench 上和零分无法区分。核心结论是:固定任务和脚手架换模型,增益平均移动 0.142;固定任务和模型换脚手架,只移动 0.079,前者约为后者 1.8 倍。原生脚手架并不占便宜,20 个模型乘任务的组合里,共用脚手架赢 11、原生赢 9、零平手。唯一的例外在 GAIA:两个 GPT 模型用 codex 明显更好(分别 +0.179、+0.131),Claude 和 Kimi 两边差不多。再看过程,搜得越广,也就是碰到预设的 8 个 harness 杠杆越多,增益越高(Spearman 相关 +0.34 到 +0.88);而花在细读执行 trace 上的动作比例和增益负相关。

为什么重要

它把「harness 工程正在变成一种模型能力」这件事落成了可测的指标。对做 agent 的人有两点很实在。第一,别迷信某家模型配自家工具就一定强,本基准里原生工具没有稳定优势,而且「最好用哪套脚手架」还因模型而异。第二,搜索广度比抠细节更值钱,读 trace 这种苦力活和最终增益不相关,per-case 分数摘要通常就够定位失败。它也建了一条能力阶梯:在 OfficeQA 上,5 代 GPT 的增益从 +0.03 单调涨到 +0.49,说明这个基准能分辨模型代际。

局限与存疑

种子 harness 是个任务相关的先验。三个任务是「改进一个能用的 agent」,GAIA 是「从废桩搭一个能用的」,这两种考的能力不同(诊断还是构建),但论文没有系统变化种子复杂度。作者自己承认基准「防破解但不等于破不了」,反复的开发和验证反馈仍可能奖励针对固定评测的策略。候选只限 Python,每个任务只钉一个目标模型,跨语言、跨架构、跨目标模型的泛化都没测。中间配置的差距常常小于轮次间抖动,只能分层级排不出精细名次。

术语

原文与代码

相关论文

全部论文解读