7 模型×3 Agent 框架实测:harness 影响成本远大于成功率
CShorten30 · x · 2026-09-17
Matei Zaharia 转发 Melissa Pan 的研究项目:在 Claude Code、Codex 和 Pi 三个 harness 上评测 7 个模型,得出三个反直觉发现:
- harness 选择对任务成功率影响很小,但对成本影响显著——同一模型换个框架,花费可能差很多
- 简单的 harness 也能很有竞争力
- 模型自带的官方 harness 不一定是最优选择
研究指出,数百万人正在使用编码 agent,但 harness 选择的影响此前并不清楚。
所属事件:7 模型×3 框架实测:harness 对成本影响远大于成功率(4 条相关)→
「编程与Agent」频道最新
- Agent 重试支付易重复扣款,给写操作加唯一 ID 才能查证 — gethackteam · 2026-09-17
- 开发者开源 synathic:用 Postgres 后验校验戳穿 agent 假报成功 — Gallegos_Daniel · 2026-09-17
- Jitsu 推出 Observability Exports,管道日志直连 Datadog 等 5 家平台 — nikola_mr64990 · 2026-09-17
- 开源工具 Hypit 走红:一条命令让 Claude Code 克隆爆款视频并量产 100 个变体 — nikola_mr64990 · 2026-09-17
- Agent harness 横评:Codex、Hermes Agent、Command Code 并列第一 — Teknium · 2026-09-17
- 重度量化的 Qwen 3.8 27B 自主找到无头浏览器测试自己写的代码 — satnl · 2026-09-17