训练一次 harness,四个模型的 Terminal-Bench 都涨了
Megadragon9 · reddit · 2026-07-24
只训练 harness,不训练模型本体,也能把 Terminal-Bench 拉高
作者分享了一个实验:他们训练的不是底座模型,而是 agent harness 本身——也就是 prompts、tools、context management、repair loops 这些外围系统。结果是 Terminal-Bench 2.0 的分数在多个模型上都提升了,包括 DeepSeek v3.2、GPT-OSS 20B/120B、MiniMax M2.5,而且还超过了官方 Terminus 2 harness。
这套方法的要点是:
- 把模型冻结,只优化 harness
- harness 代码只有一个 Python 文件
- 训练循环会提出修改,再按量化标准决定是否晋级
- 作者用一台租来的、带 5090 GPU 的服务器跑了一个小模型 Qwen 3.6 35B A3B NVFP4 来训练 harness
作者认为,这种方式带来的改进具有一定 跨任务环境迁移性,而不是只对训练时用的模型有效。文章还提到,他们顺手做了一个更通用的、类似 PyTorch 风格的 agent harness 训练框架,可接 OpenAI-compatible API,也能用于 Terminal-Bench 和 SWE-Bench;最初版本最大的短板是 确定性不足。
「编程与Agent」频道最新
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11