Berkeley 研究对比三大编程 Agent:外壳选错,成本差异远超准确率
arena · x · 2026-09-29
Arena 发布视频,由 UC Berkeley Sky Computing Lab 博士生 Melissa Pan 对比 Claude Code、Codex 与 Pi 三个编程 agent。她提出「harness tax(外壳税)」概念:模型外围的系统编排(提示词组织、工具调用、循环设计)会显著影响成本与性能。
她报告了三个反直觉发现,第一条是:外壳(harness)的选择对成本的影响大于对准确率的影响——即同样的模型,搭在不同 agent 框架里,花费差异可能远大于效果差异。完整结论与对低成本构建编程 agent 的启示见完整视频。
「编程与Agent」频道最新
- 开源 Collaborator:把终端、上下文和代码放上无限画布的 Agent 开发环境 — adnan_hashmi · 2026-09-29
- 用 Codex 跑 5 天枚举全网已发表 AI 安全点子 — AaronBergman18 · 2026-09-29
- Sonnet 5.5 上线 Conductor,基准成绩图"出人意料" — charlieholtz · 2026-09-29
- Agent 浏览会被封杀?有人提议给 AI Agent 配"类 Tailscale VPN" — alexisgallagher · 2026-09-29
- 开发者实测称 opencode 是当前最强编程 Agent,大幅领先对手 — dh7net · 2026-09-29
- 一句话给应用加客服 Agent:复用现有 API,5 分钟上线 — CShorten30 · 2026-09-29