7 个模型实测:编码 agent 的 harness 不影响成功率却显著影响成本
DavideCrapis · x · 2026-09-17
Melissa Pan 团队将 7 个模型分别在 Claude Code、Codex 和 Pi 三种 harness 上评测,得出三个反直觉发现:
- harness 选择对任务成功率影响很小,但对成本影响显著
- 简单的 harness 也可以很有竞争力
- 模型的“原生 harness”并不总是最佳选择
研究指出,虽然数百万人正在使用编码 agent,但 harness 选择的影响此前一直不明确,这项工作填补了这一空白。
所属事件:7模型×3 harness实测:换壳不影响成功率却显著影响成本(5 条相关)→
「编程与Agent」频道最新
- 《超暗工厂》假想 2029:代码审查沦为形式,月增 35T token — bratton · 2026-09-17
- 博主亲见:有人用 OpenClaw 跑通整家公司运营 — heyneighbor · 2026-09-17
- Qwen Code Desktop v0.24.0 发布:Linux 沙箱、钉钉通道与跨会话消息 — github-actions[bot] · 2026-09-17
- Nvidia 开源 Agora:用 Git 做共享记忆,13 个 AI Agent 无监督连跑 12 天 — nvidia · 2026-09-17
- 开源 AgenC 发史上最大版本:28 天 658 次提交,还推出桌面端 — tetsuoai · 2026-09-17
- GitHub 用 AI 把 Copilot runtime 重写为 80 万行 Rust,一人数月完成 — PaulShellDev · 2026-09-17