专题 · FULL STORY

HarnessTax:编码框架如何影响成本

Melissa Pan 团队发布 HarnessTax 评测,将 7 个模型放入 Claude Code、Codex、Pi 三套编码 harness 实测。研究随后在 X 与 Hacker News 引发热议:框架不改变成功率,却使成本相差达五倍。

2026-09-17 ~ 2026-09-22 · 3 集 · 12 条

第 1 集 · 7模型×3套编码harness实测:影响成本远大于成功率(2026-09-17,7 条)

Melissa Pan 团队发布一项评测:将 7 个模型分别放进 Claude Code、Codex 和 Pi 三套编码 agent harness 中运行,考察换壳对性能与成本的影响。核心结论反直觉:harness 的选择对任务成功率影响很小,但对成本影响显著;模型的原生 harness 未必最优,简单 harness 也能有不错表现。该结果经 Matei Zaharia、Hamel Husain 等多位社区人士转发后引发广泛讨论。

已确认

  • 评测覆盖 7 个模型 × 3 个 harness(Claude Code、Codex、Pi),核心发现是 harness 选择对成功率影响小、对成本影响大
  • dbreunig 转述 melissapan 的实测数据并提出「harness 税」概念:在 SWE-bench Lite 上,Claude Code 成功率 97.8%、每次 rollout 成本 $1.33;Pi 成功率 96.7%,成本约为其一半,成功率仅差 1.1 个百分点
  • Hamel Husain 转发的量化分析补充:同样运行 Fable 5,Pi 与 Claude Code 的平均轮次几乎相同(15.4 vs 15.3),但成本差出一倍

为什么重要

  • 对团队选型有直接参考价值:不同 harness 的成本差异可达约一倍,而成功率差异仅在 1 个百分点量级
  • 提示评测与采购决策中不应默认使用模型厂商的原生 harness,换用更简单的 harness 可显著压缩 agent 运行成本
  • DavideCrapis、CShorten30、blaizedsouza、mateizaharia、Hamel Husain 等多位转发者的关注说明该发现引发了社区热议

第 2 集 · 实测21个模型框架组合:Agent框架影响成本而非成功率(2026-09-19,2 条)

一项名为 HarnessTax 的编码 Agent 评测研究在 X 和 Hacker News 热榜上引发关注。作者对 7 个模型与 3 种 harness(含 Claude Code、Codex 等)共 21 个「模型–框架」组合进行实测,得出关键发现:更换 Agent 框架对任务成功率几乎没有影响,却会大幅改变运行成本,即 harness 的选择主要影响成本而非效果。

第 3 集 · 研究称编码智能体 harness 不改成功率却致成本差五倍(2026-09-21,3 条)

UC Berkeley 团队发布的 HarnessTax 研究量化了编码智能体所用 harness(智能体框架)对性能与成本的影响。实验覆盖 21 组模型×harness 组合,在 60 个任务上测试发现:不同 harness 下成功率十分接近,但同一模型的账单成本最多可相差 5 倍。这表明选择合适的 harness 是降低智能体使用成本的重要手段。