可复用 Agent Harness 训练框架
Megadragon9 · reddit · 2026-07-21
这条帖子介绍了一个名为 harness-training 的项目:它不是只训练某个单独任务模型,而是训练一个可复用的 agent harness(任务外壳/执行框架)。
作者的思路是:先用一个冻结的任务 LLM 和任务环境训练 harness,之后再替换成不同的任务 LLM,在新的环境里评估同一个“冻结后的 harness”。目前实现支持任意 OpenAI-compatible API,并可直接对接 Terminal-Bench 和 SWE-Bench,也方便扩展到其他任务环境。
帖子还说明了训练方式:把 baseline vs candidate 的判定当作 loss,候选方案若通过就用 git commit 形式推进为新 baseline,没通过则保留为引用;项目目标是让不同模型、不同任务之间的能力迁移更强。作者提到配套博客里展示了框架在 Terminal Bench 2.0 上的改进,以及从 SWE-Bench 训练迁移到终端任务上的效果;同时总结出一个关键教训:原始版本里缺少 determinism(确定性)。
所属事件:研究称强化学习模型的泛化能力主要由外部 Harness 主导(10 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11