UC Berkeley 研究:harness 几乎不影响成功率,成本却可差 5 倍
solyarisoftware · x · 2026-09-22
UC Berkeley 团队发布 HarnessTax 研究,量化 coding agent 的 harness 对性能与成本的真实影响。实验覆盖 21 组模型-harness 组合、7 个模型、SWE-bench Lite 与 Terminal-Bench 2.0 两个基准,每组 30 任务、3 次重复,并用 bootstrap 估计 95% 置信区间。
核心发现:
- 成功率几乎不变:同一模型换 harness,SWE-bench Lite 上成功率平均变化在 ±2% 内,Terminal-Bench 约 ±5%。
- 成本差距巨大:Claude Code 在 SWE-bench Lite 上平均比 Pi 贵 2.0 倍、比 Codex CLI 贵 1.6 倍。最明显的例子是 Claude Fable 5:在 Claude Code 与 Pi 上成功率分别为 97.8% 和 96.7%,但单次尝试成本 $1.33 vs $0.67,翻了一倍(平均轮次几乎相同)。
- 原因在初始上下文:Claude Code 的首调上下文是 Pi 的 10 倍以上;Pi 只提供 read、write、edit、bash 四个工具,指令与 schema 更紧凑。
- 结论:极简开源 harness Pi 在两个基准上都达到成本-效果 Pareto 前沿。选 coding agent 实际上是在同时选模型和 harness。
所属事件:研究称编码智能体 harness 不改成功率却致成本差五倍(3 条相关)→
「编程与Agent」频道最新
- 免费25页指南:用Python从零构建带工具循环的编码Agent — Al_Grigor · 2026-09-22
- 重度使用 Claude 写码,是在变强还是只变快?Reddit 热议 — Apprehensive_Set3897 · 2026-09-22
- 三个模型联手做鲸鱼城决策游戏,264 段视频 5 分钟生成 — huangyun_122 · 2026-09-22
- 给 Agent 完全自主权后它只会瞎忙:无目标 Agent 实战翻车 — impact_founder · 2026-09-22
- Grounded Document Agent:长 PDF 问答带页码引用,全本地跑通 — Roger_M_Taylor · 2026-09-22
- Synara v0.9.0 将 Computer Use 带入 macOS 原生应用 — CurieuxExplorer · 2026-09-22