EvoHarness-RL:教 8B agent 按需读写外存,ALFWorld 96.9% 追平 Claude Opus

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He

COLM 2026

cs.LG, cs.CL

2026-08-06

把 agent 的外部状态拆成 belief/progress/experience,用监督微调加代价感知 GRPO 学何时读写,Qwen3-8B 在 ALFWorld 拿 96.9%,追平 Claude Opus 4.5。

这篇在解决什么

长程任务里,LLM agent 得靠外部支架记东西:物品在哪、当前进行到第几步、上一轮哪个套路管用。现在的做法是把记忆和工具塞进 prompt,或者用启发式规则决定何时读写,这套「外部状态用什么、什么时候用」的策略基本是手调的。

这带来两个耦合问题。一是从嘈杂的交互轨迹里提炼出有用的状态,二是在运行时判断此刻值不值得花代价去读写外部状态。论文把这两件事合起来叫 harness policy learning:让 agent 离线学会一套对外部状态的操作策略,上线后自己维护这套状态。

方法

EvoHarness-RL 把异质的外部组件抽象成三类 policy 能直接操作的状态,合称 BPE:

对外的动作只有四个元动作:track[object] 读 Belief、commit[subgoal] 写 Progress、recall[query] 取经验、note[insight] 记新洞察。这套设计把领域差异收进一个 environment adapter 里,policy 看到的动作空间是统一的。

训练分两段。第一段监督微调,拿专家演示教 base 模型这套动作语义和怎么构造有用状态。第二段是代价感知的 GRPO,轨迹级奖励为:

R = Rsucc + λeff · Reff + λdiv · Rdiv − λspam · Rspam − λinv · Rinv

成功奖励是 10×1[solved],效率项 Reff = max(0, 1 − |τ| / Tmax) 鼓励短轨迹,再加上动作多样性奖励和重复、格式惩罚。关键是那个效率项:它逼着 agent 别每一步都去碰外部状态,只在值得的时候碰。

结果

主实验在 ALFWorld(文本化家庭任务,140 个 seen 任务,6 类):

方法骨干平均成功率
ReActQwen3-8B47.9%
GRPOQwen3-8B65.6%
SkillOSQwen3-8B80.2%
SkillRLQwen2.5-7B89.9%
EvoHarness-RLQwen3-8B96.9%

相对 ReAct 提升了 +49.0 个绝对点。阶段拆开看:只在推理时挂上 harness(Base)56.4%,加上 SFT 68.6%,再加 GRPO 到 96.9%,两段训练缺一不可。

把推理时 harness 挂到前沿模型上,弱模型涨得多:GPT-4.1 从 47.9% 到 70.0%(+22.1),GPT-5 从 60.7% 到 85.0%(+25.7);已经接近天花板的 Claude Opus 4.5 从 96.4% 到 98.5%(+2.1)。

换到 unseen 任务,ReAct 50.0%,EvoHarness-RL 86.6%。BPE 三件套拆掉任意一件,Base 成功率从 56.4% 掉到 48.6% 到 50.7% 之间,三者是协同的,经验(Experience)最不能少。

为什么重要

核心主张是:帮长程 agent 的不是更大的记忆或更强的工具,而是「一套可训练的外部状态操作策略」。8B 模型在前沿模型已接近天花板的 benchmark 上打平 Claude Opus,靠的是把记忆使用本身变成被训练的对象。

训练过程还露出一个叫 harness annealing 的现象。训练前期 agent 频繁调用 harness,像个靠脚手架的新手;随着 GRPO 推进,反复出现的使用模式被内化进 policy,调用次数下降到大约每 episode 一次,agent 转向「按需」访问。这跟「堆更多 RAG」是反方向的:先外化,再逐步收回。

局限与存疑

只在 ALFWorld 一个环境上验证,这是它最大的短板。ALFWorld 是文本化的家庭任务,作者自己承认这个环境偏重 Experience,换个领域可能 Belief 或 Progress 更关键。BPE 是个功能抽象,落地仍要为每个领域写 environment adapter,并不是即插即用。

「8B 打平 Claude Opus」要打折看。ALFWorld 上前沿模型本就在 96% 附近,差距本就很小;96.9% 是单一窄任务上的数字,换到更开放的代码、网页类长程任务表现如何没有测。

训练要专家演示做 SFT,再加 GRPO,两段流水线的成本不低。论文正文没有正式的局限性章节,以上判断多为读毕的存疑。

术语

原文与代码

社区讨论

相关论文

全部论文解读