Harness-R1:让智能体从失败轨迹中学习并自我打补丁

dair_ai · x · 2026-08-05

DAIR.AI 介绍了名为 Harness-R1 的自改进智能体新方法。该方法利用智能体在生产环境中积累的失败轨迹作为训练数据,通过在线强化学习训练一个专门的 9B 参数“工程师模型”。\n\n该工程师模型能将目标智能体的失败批次转化为经过验证的可执行补丁,从而在不改变原目标模型权重的前提下,提升其在实际运行时的表现。实验显示,在 WebShop、ALFWorld 和 DBBench 基准测试中,该方法使原版 Qwen3.5-9B 的成功率从 44.3% 提升至 53.6%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →