同一模型跑不同编码 harness:成功率仅差几个点,成本最高差 5 倍

JeremyCMorgan · x · 2026-09-25

Berkeley 与 Arena 用 Claude Code、Codex CLI 和 Pi 三个 harness 跑了 7 个模型,发现同一模型同一任务下,成功率差异只有几个百分点,但成本差异最高达 5 倍。结论:如果按 token 付费,harness 本身就是一笔显著开支;作者提醒看结果时注意样本量限制,再决定是否切换工具。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →