7 模型×3 编码 Harness 实测:Harness 选择影响成本而非成功率
CShorten30 · x · 2026-09-20
一篇编码 Agent 评测研究在 X 和 Hacker News 上引发关注(项目名 HarnessTax 登上 HN 热榜)。作者在 Claude Code、Codex 和 Pi 三种 harness 上评测了 7 个模型,得出三个反直觉发现:
- Harness 选择对任务成功率影响很小,但会显著影响成本——即选错 harness 可能不降低质量却大幅烧钱;
- 简单的 harness 就有竞争力,复杂编排未必带来回报;
- 模型原生官方 harness 并不总是最优选择。
结论对每天都在用编码 Agent 的开发者很有参考价值:与其堆叠复杂框架,不如先验证简单 harness 的实际成本/收益。
所属事件:实测21个模型框架组合:Agent框架影响成本而非成功率(2 条相关)→
「编程与Agent」频道最新
- 用 Jev 为自定义 Agent 搭建每轮持续验证器 — omarsar0 · 2026-09-20
- Omarchy 带火 Linux 桌面,2026 或成 Linux 桌面之年 — mark_k · 2026-09-20
- 有 Agent 滥用文档请求实现任意远程代码执行 — zainhas · 2026-09-20
- Yacine:能在手机上写代码后,刷推时间大幅缩水 — yacineMTB · 2026-09-20
- 开发者上线 Skills 浏览站,可视化流程图看懂 AI 技能逻辑 — spersingerorinda · 2026-09-20
- 30 分之一成本达到 99.5% 一致:两个「jev」小模型实战用例 — multiply_matrix · 2026-09-20