评测 7 个模型 × 3 套 Coding Harness:原生工具并非总最优,成本差很多
blaizedsouza · x · 2026-09-17
一项针对 Claude Code、Codex 和 Pi 三套 harness 的评测跑了 7 个模型,得出三个反直觉发现:
- Harness 选择对任务成功率影响很小,但对成本影响显著
- 简单 harness 就能打得过复杂方案
- 官方原生 harness 并不总是最好的
这意味着数百万人使用的 coding agent,其 harness 选择的影响其实一直不清楚。LangChain 创始人 Harrison Chase 转发并评论称「模型未必真的受益于原生 harness」——对选型有直接参考价值。
所属事件:7模型×3套编码harness实测:影响成本远大于成功率(7 条相关)→
「编程与Agent」频道最新
- 用户开 4 个 Astra subagents 仍抱怨额度难烧完 — Aryvyo · 2026-09-22
- jevframe:用自然语言为 pandas/Polars 批量做文本分类与打分 — _ScottCondron · 2026-09-22
- 7 种让 AI 自己验证答案的实用技术全解析 — goyalshaliniuk · 2026-09-22
- Claude Code 用户或浪费 80% 上下文,10 个省 token 工具盘点 — bibryam · 2026-09-22
- Cloudflare 开源安全审计 skill:六阶段把编码 agent 变成漏洞猎手 — evilsocket · 2026-09-22
- 开源 notjev:用单 token+logprobs 把本地 LLM 变成快速决策引擎 — n8tz · 2026-09-22