伯克利研究:75%场景下开源Agent框架跑赢Claude Code等官方工具
solyarisoftware · x · 2026-09-22
UC Berkeley 与 Arena 发布「Harness Tax」研究,在 SWE-bench Lite 和 Terminal-Bench 2.0 上测试了 21 组模型×Agent 组合,对比 Claude Code、Codex CLI 与极简开源框架 Pi。
核心发现:
- 前沿模型在大约 75% 的情况下,在最小化的开源框架上表现反而更好;
- 作者称用 Pi 替代官方工具可省约 50% 的 agent API 成本,而 benchmark 成绩几乎不掉;
- 结论挑战了「官方 harness 更优」的直觉:大厂自带框架可能让用户为「Harness Tax」白白买单。
注意:该推文以引述口吻传播,具体模型版本与数据以原论文为准。
所属事件:伯克利研究称Agent框架选择可致成本差5倍(4 条相关)→
「编程与Agent」频道最新
- 独立开发者上架 Storewake MCP:$19/月查询 App Store 排名与收入 — Pfernan95 · 2026-09-22
- 语音 Agent 丢失语气与说话人特征,Reddit 讨论分层保留方案 — Excellent_Baseball43 · 2026-09-22
- 免费工作坊详解:用 LLM Wiki 给 Agent 搭长期记忆 — Al_Grigor · 2026-09-22
- 拆散实时语音栈成本降 14 倍,意外收获是文本层护栏 — Cloudsurfer_90 · 2026-09-22
- Agent 最后一公里:结构化输出交给 Gamma 渲染成可读报告 — raw-hit10 · 2026-09-22
- 粉丝为 OpenAI Codex 桌面端做了个会唱歌的 Ado Q版桌宠 — secemp9 · 2026-09-22