同一模型跑不同编码 harness:成功率仅差几个点,成本最高差 5 倍
JeremyCMorgan · x · 2026-09-25
Berkeley 与 Arena 用 Claude Code、Codex CLI 和 Pi 三个 harness 跑了 7 个模型,发现同一模型同一任务下,成功率差异只有几个百分点,但成本差异最高达 5 倍。结论:如果按 token 付费,harness 本身就是一笔显著开支;作者提醒看结果时注意样本量限制,再决定是否切换工具。
「编程与Agent」频道最新
- 「谁有最没法合并的 AI 代码泥潭?」开发者公开征集名场面截图 — pvncher · 2026-09-25
- 开源工具 Wake:把散落本地的 Claude/Codex 会话聚合成一个可搜索窗口 — tom_doerr · 2026-09-25
- 开源轻量浏览器 curf:250KB 体积,专为 AI agent 可操控而生 — jasonkneen · 2026-09-25
- Reddit 征集 AI Agent 失控案例:无限重试、循环互甩、一夜烧光额度 — masterai01 · 2026-09-25
- Auto-Research Arena:6300 次运行中 AI 智能体独立重发现前沿 LLM 架构思路 — qixing_huang · 2026-09-25
- 2026 年用 AI 的分水岭:项目上下文数字化+用上 Agentic 工具 — Afinetheorem · 2026-09-25