Databricks benchmark 显示,coding agent 成本更受 harness 影响而非 token 价
Substantial-Heat-321 · reddit · 2026-07-26
这条帖子的核心观点是:我们可能在错误的层面衡量 coding agent 的成本。
作者引用 Databricks 在一个多百万行、多语言代码库上的 benchmark 指出,单看 token 价格,并不能预测真实工程任务的成本。在测试里,同一个模型的完成成本会因为 harness 不同而相差 2 倍以上;而某个 harness 每轮送回上下文的内容少了大约 3 倍,却仍然能达到相近质量。
作者认为更有意义的指标应该是:
- 单个已验证任务成本 = 模型 + 工具 + 上下文 + 重试成本,再除以真正通过检查的任务
他进一步解释,harness 会显著影响成本:哪些信息会回流进上下文、失败怎么摘要、何时跑测试、agent 能不能盲目重试、状态能保留多少轮。最后他抛出两个实践问题:团队是否应记录“每个合并 PR 成本”或“每个 green task 成本”?比较 agent 时,是否应该把 harness 固定住,而不是把它当成模型的一部分一起评估?
「编程与Agent」频道最新
- Cotan2 作者称 AI 网格编辑器可能不再继续演进 — rms80 · 2026-07-26
- Claude Code 以细节打磨出罕见顺手的编程体验 — prateekj · 2026-07-26
- Codex Micro 实时语音模式或让键盘退居次要输入 — dkundel · 2026-07-26
- 开源 Bento 用单个 HTML 文件做出动画 PPT — vista8 · 2026-07-25
- 看再多 Claude Code 视频也学不会,先改掉一个手工流程 — tomcrawshaw01 · 2026-07-25
- 这块 Codex 微控制器够高级,改键后更顺手 — dkundel · 2026-07-25