可复用 Agent Harness 训练框架
Megadragon9 · reddit · 2026-07-21
这条帖子介绍了一个名为 harness-training 的项目:它不是只训练某个单独任务模型,而是训练一个可复用的 agent harness(任务外壳/执行框架)。
作者的思路是:先用一个冻结的任务 LLM 和任务环境训练 harness,之后再替换成不同的任务 LLM,在新的环境里评估同一个“冻结后的 harness”。目前实现支持任意 OpenAI-compatible API,并可直接对接 Terminal-Bench 和 SWE-Bench,也方便扩展到其他任务环境。
帖子还说明了训练方式:把 baseline vs candidate 的判定当作 loss,候选方案若通过就用 git commit 形式推进为新 baseline,没通过则保留为引用;项目目标是让不同模型、不同任务之间的能力迁移更强。作者提到配套博客里展示了框架在 Terminal Bench 2.0 上的改进,以及从 SWE-Bench 训练迁移到终端任务上的效果;同时总结出一个关键教训:原始版本里缺少 determinism(确定性)。
所属事件:研究称强化学习模型泛化能力主要由外部 Harness 主导(9 条相关)→
「编程与Agent」频道最新
- 智能体自治别急着放权,先跑波次找摩擦点 — JnBrymn · 2026-07-22
- Coding agents 正走向 AI 写、AI 审、人工批的流程 — aftahi_ai · 2026-07-22
- oMLX 0.5.2 增加菜单栏统计和低比特解码内核 — awnihannun · 2026-07-22
- GitHub 机器人审到上限,PR 还要等 39 分钟 — DanielLockyer · 2026-07-22
- Codex Remote 的 Max 推理强度疑似只在移动端开放 — GabGarrett · 2026-07-22
- 有人用 MCP 做了个 demo,主张商店应把价格和购物车开放给 AI — gelembjuk · 2026-07-22