176 组对照实验:Agent Harness 设计对成绩影响被系统量化
alex_verem · x · 2026-09-25
UMass Amherst、Zoom、Emory、UNC Charlotte 研究者发布论文《An Empirical Study of Harness Design for Coding Agents》,保持模型不变、只改 harness 层(规划、动作空间、上下文管理),在 SWE-Bench Verified(500 个真实 GitHub 问题)和 Terminal-Bench 2.1(89 个命令行任务)上跑了 176 组匹配设置,覆盖 5 种上下文管理策略、4 种上下文窗口预算。
主要发现:
- 上下文管理:上下文窗口越紧张收益越大,主要作用是防止上下文溢出失败。先规则裁剪、再 LLM 摘要的分级策略效率最高;让被裁剪内容可恢复的机制模型几乎不用,无精度收益。
- 规划:对弱模型是精度脚手架(Nemotron-3 30B 无规划时中位数 5 轮就停,成功率从 25.2% 跌到 13.6%),对强模型则是省成本手段——成本降约 30% 而精度变化不到 2 个点。
- 工具:bash 能力弱的模型受益于预定义工具(Mistral Medium 3.5 无预定义工具时从 68.6% 掉到 45.4%);而 Nemotron-3 550B 用纯终端反而解出更多任务且成本低 53%。
- 32k 窗口无内存管理时,78.7% 的 GitHub 任务因上下文溢出失败;加裁剪/摘要后同一模型成功率升至 51%–58%。
结论:没有普适最优配置,harness 各组件应按模型、任务和预算选型;benchmark 分数衡量的是「模型+harness」整体,而 harness 能解释其中相当大一部分。
所属事件:176 组对照实验系统量化 Agent Harness 设计影响(2 条相关)→
「编程与Agent」频道最新
- 开发者称 Codex 已完全取代 Claude Code 成主力编程工具 — eptwts · 2026-09-25
- Weco 预印本:agent 八天自主改进自身软件七项,提升泛化到四个保留基准 — VraserX · 2026-09-25
- 让 Amp 把 Mac Mini 变成 Codex 远程电脑操控机,含完整 prompt 与 skill — iannuttall · 2026-09-25
- GitHub 安全实验室发布 AI 驱动 Fuzzing 流水线,一键自动挖 C/C++ 漏洞 — mboehme_ · 2026-09-25
- 基于 BrowserAct 模板改出可复用 Google Maps 客户线索抓取机器人 — alifcoder · 2026-09-25
- 独立开发者借新模型热度做主题皮肤,蹭 LLM 发布涨 MRR — marclou · 2026-09-25