伯克利研究:75%场景下开源Agent框架跑赢Claude Code等官方工具

solyarisoftware · x · 2026-09-22

UC Berkeley 与 Arena 发布「Harness Tax」研究,在 SWE-bench Lite 和 Terminal-Bench 2.0 上测试了 21 组模型×Agent 组合,对比 Claude Code、Codex CLI 与极简开源框架 Pi。

核心发现:

注意:该推文以引述口吻传播,具体模型版本与数据以原论文为准。

所属事件:伯克利研究称Agent框架选择可致成本差5倍(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →