CMU 论文用 RL 训练 4B 提案模型改 harness 代码,反超 35B 教师
omarsar0 · x · 2026-10-04
CMU 的新论文提出「harness learning」:不改模型权重,而是通过编辑 agent 的 harness 代码来提升表现。
- 用 RL 训练一个提案(proposer)模型,输入任务、当前 harness 与执行报告,输出对 harness 的代码修改
- 奖励信号就是修改后 harness 的任务得分,solver 模型本身始终不变
- 训练出的 4B 提案模型在 Reasoning Gym 的单步修改上击败了自己的 35B 教师模型,包括训练中没见过的任务族
- 在 HotpotQA 上训练的提案模型可以泛化到 MuSiQue 和 2WikiMultihopQA
作者认为「通过编辑 harness 代码而非权重来改进 agent」正在成为一项重要的 AI 工程技能。
「编程与Agent」频道最新
- Vercel 年化营收达 6 亿美元,一半新业务来自编程 Agent — evilrabbit_ · 2026-10-04
- Hallmark:让 Claude Code 生成界面告别 AI 味的 29.5k 星技能 — tom_doerr · 2026-10-04
- 别再靠微调修检索问题:Oracle 工程师讲知识该放哪 — AI Engineer · 2026-10-04
- 用 MCP 存决策图谱:隔周回到 Agent 项目也能追溯每条结论 — Mountain-Raise-4556 · 2026-10-04
- 极客用 Lean 语言完整重写《毁灭战士》,还顺手加了形式化证明 — akbirthko · 2026-10-04
- 自研极简编码 agent Jin:只用 3 种 API 标准,用 prompt 替代 MCP — aldapsiger · 2026-10-04