「Harness 税」实锤:同样 15 轮,Claude Code 成本是 Pi 的两倍
HamelHusain · x · 2026-09-17
Melissa Pan 对智能体框架的成本差异做了量化分析,转发自 Hamel Husain:在 SWE-bench Lite 上,Pi 与 Claude Code 运行 Fable 5 的平均轮次几乎相同(15.4 vs 15.3),但 Claude Code 成本约是 Pi 的两倍,换来的成功率提升仅 1.1 个百分点。
关键发现:
- 差异可从第一次模型调用观察到:Claude Code 的初始上下文平均超过 Pi 的 10 倍,指令更长、工具 schema 更大
- 这解释了「harness tax」(框架开销税)的来源——脚手架本身吃掉大量 token
- 作者主张:随着模型能力增强,agent 需要的脚手架会减少,harness 设计应优先考虑成本效率与可靠性
对正在选型或自建 agent 框架的团队有直接参考价值:框架的开销可能比模型本身更烧钱。
所属事件:实测「Harness 税」:编码框架不影响成功率却让成本翻倍(7 条相关)→
「编程与Agent」频道最新
- Claude Code 嫌功能太简单拒绝代写:让用户「自己动手实现」 — bendee983 · 2026-09-17
- 微软 MarkItDown 斩获 10 万星:任意文件一键转 Markdown — mdancho84 · 2026-09-17
- LLM agent 从 demo 到生产会先死在哪?工具响应、上下文与重试循环成重灾区 — Substantial_Bus_5237 · 2026-09-17
- 「上下文与代码同住」:开发者重提 Knuth 的 literate programming — carsonfarmer · 2026-09-17
- 换用 Jev 给推文分类:比最快 LLM 快 6 倍、便宜 40 倍 — altryne · 2026-09-17
- 开发者实测:Jev 做推文分类比最快 LLM 便宜 40 倍 — altryne · 2026-09-17