同一模型换 harness 账单差 5 倍,HarnessTax 实测 21 种组合
CShorten30 · x · 2026-09-22
HarnessTax 团队对 21 种模型-harness 组合在 60 个任务上做了成本与成功率测试,发现成本波动远大于成功率波动:
- 同一模型在不同 harness 下,单次尝试成本从 $0.67 到 $1.33(5 倍差距)
- 成功率差距却很小:97.8% vs 96.7%
- 12 个轻量配置中有 9 个跑赢厂商默认配置
- Claude Code 和 Pi 平均每次任务 15 轮交互,但重型配置携带的初始上下文是轻量的 10 倍以上——更长的指令和更大的工具定义随每次调用反复传输
研究合著者 melissapan 指出,harness 选择目前多靠「部落知识」和口口相传,很难判断哪个配置在自己的工作负载上性价比最优。作者将其定位为一次「采购测试」,轻量配置仍占据成本-成功率前沿。
「编程与Agent」频道最新
- Question's Gambit:检索前预处理让 GPT-5.5 深研成绩从 83.1% 升至 90.5% — omarsar0 · 2026-09-22
- 开发者开源 e-drums 接入 Ableton 工具,称可让 agent 适配任意电鼓 — _Dave__White_ · 2026-09-22
- Chollet:可以委托写码,永远不要委托理解 — round · 2026-09-22
- 开发者用 Jev 自动审核社交媒体帖子并开源 npm 包 modsure — RealDannyhvv · 2026-09-22
- TypeSafe 两级抽取级联:小模型初抽+验证器把关,成本仅推理模型零头 — TheMoonMidas · 2026-09-22
- Lex 创始人 Nathan Baschez 宣布加入 Notion,将打造人机协作思考空间 — nbaschez · 2026-09-22