Databricks benchmark 显示,coding agent 成本更受 harness 影响而非 token 价

Substantial-Heat-321 · reddit · 2026-07-26

这条帖子的核心观点是:我们可能在错误的层面衡量 coding agent 的成本。

作者引用 Databricks 在一个多百万行、多语言代码库上的 benchmark 指出,单看 token 价格,并不能预测真实工程任务的成本。在测试里,同一个模型的完成成本会因为 harness 不同而相差 2 倍以上;而某个 harness 每轮送回上下文的内容少了大约 3 倍,却仍然能达到相近质量。

作者认为更有意义的指标应该是:

他进一步解释,harness 会显著影响成本:哪些信息会回流进上下文、失败怎么摘要、何时跑测试、agent 能不能盲目重试、状态能保留多少轮。最后他抛出两个实践问题:团队是否应记录“每个合并 PR 成本”或“每个 green task 成本”?比较 agent 时,是否应该把 harness 固定住,而不是把它当成模型的一部分一起评估?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →