Databricks发布企业内部代码基准,架构比模型更影响成本
Databricks 联合创始人 Matei Zaharia 近期发文分享了基于公司内部数百万行代码库构建的 AI 编程基准测试。由于 SWE-Bench 等公开基准容易被过度优化,Databricks 改用工程师真实做过的任务来评估大模型在大型企业级代码库中的实际表现。该评测揭示了模型表现、架构设计以及成本控制方面的诸多反直觉结论,为企业部署 AI 编程智能体提供了重要参考。
关键细节与模型表现
该内部代码库包含 Scala、Go、Rust、Java、TypeScript、Python 等多种语言。Zaharia 指出,许多模型(包括开源模型)在顶级水平上已经具备极强竞争力。例如,GLM 5.2 进入了 Databricks 的最高能力档,并且在质量上与 Claude Opus 4.8 统计上打平,这种进步在与 SWE-Bench 等很不一样的代码库中也同样成立。
架构设计与成本误区
评测表明,在相同模型和代码库下,运行架构(harness)的选择会导致成本与性能出现巨大差异。架构通过控制代码搜索、上下文管理、工具编排和测试循环等环节影响表现。Zaharia 强调,一个简单的 Pi harness 就能做到与厂商提供的 harness 相近的成功率,但成本低一半。此外,单看每 token 价格会误导决策:例如 Sonnet 5 虽然每 token 比 Opus 4.8 便宜,但在任务中消耗了更多 token,导致总成本更高且质量更低。
最优策略与工具发布
综合评测结果,目前不存在一种模型能解决所有问题,最佳的帕累托前沿(性价比最优)需要组合使用 OpenAI、Anthropic 与开源模型。为此,Databricks 推出了名为 Omnigent AI 的“元框架”,允许开发者自由切换和组合不同的 agent,以实现企业内部特定任务的最优配置。
2026-07-09 ~ 2026-07-11 · 16 条相关
一手来源
- Databricks测内部编码智能体 — matei_zaharia ·
- GLM 5.2编码表现进步明显 — matei_zaharia ·
- 别只看每token价格 — matei_zaharia ·
- 【源头】Databricks测内部编码智能体 — matei_zaharia · 2026-07-09
- 为什么要做内部编码基准 — matei_zaharia · 2026-07-09
- 内部任务测出模型竞争力 — matei_zaharia · 2026-07-09
- 【源头】GLM 5.2编码表现进步明显 — matei_zaharia · 2026-07-09
- 编码智能体的harness很关键 — matei_zaharia · 2026-07-09
- 【源头】别只看每token价格 — matei_zaharia · 2026-07-09
- 开发者可切换组合Agent框架 — matei_zaharia · 2026-07-09
- Databricks构建超大规模代码基准测试 — matei_zaharia · 2026-07-09
- Databricks编码Agent评测:架构决定成本 — rajistics · 2026-07-09
- Databricks创始人:企业需定制内部AI编程Agent — AlexGDimakis · 2026-07-09
- Databricks百万行代码库AI编程Agent评测 — petburiraja · 2026-07-09
- 在超大代码库评测编码智能体 — petburiraja · 2026-07-09
- Databricks谈代码Agent成本 — ziv_ravid · 2026-07-10
- 编码智能体评测:Pi更快更准更便宜 — vitaliychiley · 2026-07-10
- Databricks 评测编码 Agent 成本与效果 — NandaVegg · 2026-07-10
- GLM 5.2 在企业代码评测中打平Opus — rohanpaul_ai · 2026-07-11