换壳实测:7个模型跑Claude Code、Codex与Pi,原生harness未必最优
CShorten30 · x · 2026-09-17
一项评测将 7 个模型分别放进 Claude Code、Codex 和 Pi 三种 harness 中运行,得出三个反直觉结论:
- harness 选择对任务成功率影响很小,但对成本影响显著;
- 简单 harness 也能打出竞争力表现;
- 厂商原生 harness 并不总是最优。
在数百万人使用编码 agent 的当下,harness 的选择是被忽视的变量,作者认为「harness-routing」(按需选壳)值得成为新话题。
所属事件:7 模型×3 框架实测:harness 对成本影响远大于成功率(4 条相关)→
「编程与Agent」频道最新
- YC 用 GLM-5.2 造出 AI 合伙人,延迟比 OpenAI 低 31% — ycombinator · 2026-09-17
- 开发者实测 Claude Managed Agents:沙箱可独立编排 — trq212 · 2026-09-17
- 开发者改口:MCP 比命令行工具更适合大多数集成场景 — trq212 · 2026-09-17
- 给 Claude 直接定制工具形态,胜过用间接层「哄」模型 — trq212 · 2026-09-17
- Codex 额度耗尽有救:换号登录可找回全部聊天记录续用 — TheMoonMidas · 2026-09-17
- Vercel fx 默认安全审查将换用 Jev:比 GPT Luna 快 5-18 倍更准 — thesaraharminta · 2026-09-17