Berkeley 研究对比三大编程 Agent:外壳选错,成本差异远超准确率

arena · x · 2026-09-29

Arena 发布视频,由 UC Berkeley Sky Computing Lab 博士生 Melissa Pan 对比 Claude Code、Codex 与 Pi 三个编程 agent。她提出「harness tax(外壳税)」概念:模型外围的系统编排(提示词组织、工具调用、循环设计)会显著影响成本与性能。

她报告了三个反直觉发现,第一条是:外壳(harness)的选择对成本的影响大于对准确率的影响——即同样的模型,搭在不同 agent 框架里,花费差异可能远大于效果差异。完整结论与对低成本构建编程 agent 的启示见完整视频。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →