同一模型换 harness,token 消耗差 9.2 倍,实测揭示 harness 影响
zainhas · x · 2026-09-08
博主用同一个 Three.js 单页生成 prompt,横评了不同模型+harness 组合,发现 harness 对 token 用量和端到端耗时的影响远大于模型本身。
关键数据:
- GLM 5.3 Flash Max 在三个 harness 下表现悬殊:Codex 用 47.5 万 tokens/9 分钟;OMP 用 174 万/30 分钟;Opencode 用 436 万/20 分钟——同一模型 token 用量相差 9.2 倍。
- Qwen 3.8 27B x-high 在 Opencode 下反而最快(8m48s、70.7 万 tokens),在 OMP 下最慢(41 分钟、340 万 tokens)。
- 实测还记录了 TTFT、缓存命中率、工具调用与错误、是否真正打开浏览器截图验证等维度。
结论:选对 harness 比选模型更能决定编码 agent 的成本和速度,做 agent 评测必须把 harness 纳入变量。
所属事件:实测显示编程框架比模型更影响 token 消耗与耗时(2 条相关)→
「编程与Agent」频道最新
- GPT-6 Astra 疑遭误读:computer use 不在聊天框,入口藏在 Codex 与桌面端 — socialwithaayan · 2026-09-08
- Agent 抢占本地桌面烦人,开发者转向 VM/云/闲置 Mac mini 跑 Codex — paw_lean · 2026-09-08
- Mac 智能体工作区 Universe:复用现有 AI 订阅,免费起步后收费 19 美元 — tedddyoweh · 2026-09-08
- 翻出旧望远镜,让 AI 建交互星图还顺手写了个模拟器 — lvwerra · 2026-09-08
- 被忽视的模型能力:什么时候该停下来问你而不是硬猜 — sunychoudhary · 2026-09-08
- 开源 Skill 一晚清出 135GB Mac 缓存,省下 ¥1500 升配钱 — oran_ge · 2026-09-08