Harness-R1:让智能体从失败轨迹中学习自我修复
alex_verem · x · 2026-08-05
Harness-R1 论文核心
该论文提出了一种新方法 Harness-R1,通过强化学习让智能体从自身的失败交互轨迹中学习,并自动修改其运行时代码(Runtime Harness)以实现自我修复和性能提升。
工作机制
- 角色分离:引入一个专门的 9B 参数“工程师模型”,负责分析目标智能体的失败原因并生成可执行的代码补丁。
- 在线强化学习:使用基于结果的奖励(任务重跑是否成功)来训练该工程师模型,优化其修改策略。
- 性能提升:在 WebShop、ALFWorld 等基准测试中,该方法将基础版 Qwen3.5-9B 的任务成功率从 44.3% 提升至 53.6%(+9.3个百分点)。
所属事件:Harness-R1让智能体从失败中自我修复(3 条相关)→
「编程与Agent」频道最新
- 开发者用 Copilot+Luna 全自动补全 issue,16.6 美分跑通全流程 — lee_stott · 2026-09-22
- 警惕 slop 龙卷风:读推理轨迹、盯紧你的 Agent — deobfuscations · 2026-09-22
- 本地 Qwen 27B Agent 接管亚马逊账号,一次跑通自动买纸 — fuzhongkai · 2026-09-22
- Steve Yegge 提出「Agentic TPM」:让编程 agent 打入企业的最短路径 — Steve_Yegge · 2026-09-22
- Tom Yeh 出题 15 道手算 Agent 数学题:系统提示词成本怎么算 — ProfTomYeh · 2026-09-22
- apibase 一个 MCP 端点聚合 327 个工具、92 家服务商,按调用付费 — modelcontextprotocol · 2026-09-22