把 agent harness 写进提示词自我迭代,几轮就超过最大推理强度且省 60% 成本

Recursive Harness Self-Improvement

Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang

cs.LG, cs.AI

2026-07-17

把多智能体 harness 当成可文本化的提示词,每轮只跟上一版自己比,用累积偏好历史驱动迭代;在 30 个开放式 ML 研究任务上几轮就超过同族最大推理强度,opus-4.8 比内置工作流省 60% 推理成本。

这篇在解决什么

现在最强的 coding agent 不只靠底座模型,还靠 harness,也就是角色分配、指令、子智能体之间传什么、工作流怎么跳这些编排逻辑。harness 和模型在共同演化:harness 越强,跑出来的执行轨迹质量越高,这些轨迹又能回头训未来的模型。问题在 provider 内置的通用 harness 要兼顾所有用户,持续更新又贵又慢;而用户自己搭的任务级 harness 倒是可以针对单个任务优化,但怎么优化才既轻量又收敛得快,基本没人系统做过。这篇就问:能不能用很少几轮、很轻的优化,把一个用户自建的 harness 调到比加大推理强度还强。

方法

RHI 的核心选择有两个。第一,把 harness 当成提示词级别的对象,不是可执行代码:它把 agent 设计(角色、指令)和工作流(子智能体之间传的 contract、编排的 hop)都写成文本规格,优化就是改这段文本。第二,放弃种群搜索,改成「轨迹局部」比较:每一轮不跟一堆候选 harness 比,只跟自己的上一版比。

具体流程:第 i 轮,agent 用当前 harness H(i) 解题产出 output(i);评估器把 output(i) 和上一轮 output(i-1) 做成对偏好判断,存进自比历史;一个 LLM harness 优化器读这段历史(但不看评估准则),把 H(i) 改成 H(i+1)。因为 harness 空间是离散文本,没有真正的梯度,这份累积偏好历史起的是「动量-语义」信号的作用。每轮成本是 Θ(1)(一次执行 + 一次成对评估),而种群搜索是 Θ(m 平方)。

为什么优先改工作流而非角色?作者的假设是:任务相关的 contract 规定子智能体只传下游需要的、而不是整段交互历史,这相当于在智能体间通信上施加任务相关的稀疏模式,能压住冗余上下文、省 KV cache。

结果

基准是 30 个合成的开放式 ML 研究任务(量化金融、机器人、药学各 10 个),每个任务要产出一个完整代码仓库和标准化交付物,用 LLM-as-judge 做成对比较(覆盖度、严谨性、可复现、表达、工程质量、任务对齐六项),两个判官配置、三个种子。底座是 Claude Sonnet 4.6、Opus 4.7、Opus 4.8,默认都用 high 推理强度,再叠 RHI。

三条主结论。一,几轮 RHI 就把同族测试时扩展(test-time scaling)的天花板顶破:sonnet-4.6-high 加两轮 RHI 赢 sonnet-4.6-max 共 30 题里的 20 题;opus-4.8-high 加两轮 RHI 超过 xhigh、ultracode、max 全部。最硬的一条:它还赢了 opus-4.8-ultracode(内置动态多智能体工作流),说明任务级的用户 harness 写进提示词,能比 provider 内置的系统级工作流强。二,涨的不是靠多吐 token:sonnet-4.6 和 opus-4.8 的输出 token 数在迭代里几乎不动(归一化 1.42 到 1.86),分数却涨。三,成本反而降:cache 读写是主要开销,RHI 通过收紧上下文把它压下来,opus-4.8-high 加两轮 RHI 相对 ultracode 省 60% 推理成本、cache 读写降 64%。

为什么重要

对天天用 coding agent 的人,这篇指了条比「无脑加大 reasoning effort」更划算的路:与其让模型自己想更久,不如把它的协作流程针对任务重排一遍。而且这套优化发生在提示词层,不动模型、不动后端,几轮就收敛,适合用户对大量开放任务持续做轻量适配。它也呼应一个更大的判断:未来模型的进步,会越来越多来自「harness 加模型」协同,而不是单押更大模型。

要诚实的是它的边界。这是一套针对每个任务单独优化 harness 的方法,优化出的 harness 换个任务还能不能用、能不能迁移,论文没回答。而且它补不上训练时扩展:把 sonnet 加上 RHI,还是追不上直接用 opus 当底座。

局限与存疑

作者自述:RHI 是训练时扩展(换更强底座)的补充,不是替代。

存疑的地方不少。30 个任务全是合成的 ML 研究编码任务,领域窄、又是 LLM 出题、LLM 判分,没有客观 ground truth。最亮的「省 60%」是跟 ultracode 这种本身就很贵的基线比的,跟普通 max 比只省 23%。claim 2(涨不是因为多吐 token)在 opus-4.7 上自己也承认证据不足、拆不开。还有,harness 优化器本身也是个大模型调用,这笔搜索成本论文在算法里算了 Θ(1),但每轮要跑一次完整 agent 执行加判分,对真实用户的「每任务预算」到底多大,缺少量化的成本账。

术语

原文与代码

相关论文

全部论文解读