可复用 Agent Harness 训练框架

Megadragon9 · reddit · 2026-07-21

这条帖子介绍了一个名为 harness-training 的项目:它不是只训练某个单独任务模型,而是训练一个可复用的 agent harness(任务外壳/执行框架)。

作者的思路是:先用一个冻结的任务 LLM 和任务环境训练 harness,之后再替换成不同的任务 LLM,在新的环境里评估同一个“冻结后的 harness”。目前实现支持任意 OpenAI-compatible API,并可直接对接 Terminal-Bench 和 SWE-Bench,也方便扩展到其他任务环境。

帖子还说明了训练方式:把 baseline vs candidate 的判定当作 loss,候选方案若通过就用 git commit 形式推进为新 baseline,没通过则保留为引用;项目目标是让不同模型、不同任务之间的能力迁移更强。作者提到配套博客里展示了框架在 Terminal Bench 2.0 上的改进,以及从 SWE-Bench 训练迁移到终端任务上的效果;同时总结出一个关键教训:原始版本里缺少 determinism(确定性)。

所属事件:研究称强化学习模型泛化能力主要由外部 Harness 主导(9 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →