176 组对照实验:Agent Harness 设计对成绩影响被系统量化

alex_verem · x · 2026-09-25

UMass Amherst、Zoom、Emory、UNC Charlotte 研究者发布论文《An Empirical Study of Harness Design for Coding Agents》,保持模型不变、只改 harness 层(规划、动作空间、上下文管理),在 SWE-Bench Verified(500 个真实 GitHub 问题)和 Terminal-Bench 2.1(89 个命令行任务)上跑了 176 组匹配设置,覆盖 5 种上下文管理策略、4 种上下文窗口预算。

主要发现:

结论:没有普适最优配置,harness 各组件应按模型、任务和预算选型;benchmark 分数衡量的是「模型+harness」整体,而 harness 能解释其中相当大一部分。

所属事件:176 组对照实验系统量化 Agent Harness 设计影响(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →