Databricks benchmark 显示,coding agent 成本更受 harness 影响而非 token 价
Substantial-Heat-321 · reddit · 2026-07-26
这条帖子的核心观点是:我们可能在错误的层面衡量 coding agent 的成本。
作者引用 Databricks 在一个多百万行、多语言代码库上的 benchmark 指出,单看 token 价格,并不能预测真实工程任务的成本。在测试里,同一个模型的完成成本会因为 harness 不同而相差 2 倍以上;而某个 harness 每轮送回上下文的内容少了大约 3 倍,却仍然能达到相近质量。
作者认为更有意义的指标应该是:
- 单个已验证任务成本 = 模型 + 工具 + 上下文 + 重试成本,再除以真正通过检查的任务
他进一步解释,harness 会显著影响成本:哪些信息会回流进上下文、失败怎么摘要、何时跑测试、agent 能不能盲目重试、状态能保留多少轮。最后他抛出两个实践问题:团队是否应记录“每个合并 PR 成本”或“每个 green task 成本”?比较 agent 时,是否应该把 harness 固定住,而不是把它当成模型的一部分一起评估?
「编程与Agent」频道最新
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11