Databricks发布企业内部代码基准,架构比模型更影响成本

Databricks 联合创始人 Matei Zaharia 近期发文分享了基于公司内部数百万行代码库构建的 AI 编程基准测试。由于 SWE-Bench 等公开基准容易被过度优化,Databricks 改用工程师真实做过的任务来评估大模型在大型企业级代码库中的实际表现。该评测揭示了模型表现、架构设计以及成本控制方面的诸多反直觉结论,为企业部署 AI 编程智能体提供了重要参考。

关键细节与模型表现

该内部代码库包含 Scala、Go、Rust、Java、TypeScript、Python 等多种语言。Zaharia 指出,许多模型(包括开源模型)在顶级水平上已经具备极强竞争力。例如,GLM 5.2 进入了 Databricks 的最高能力档,并且在质量上与 Claude Opus 4.8 统计上打平,这种进步在与 SWE-Bench 等很不一样的代码库中也同样成立。

架构设计与成本误区

评测表明,在相同模型和代码库下,运行架构(harness)的选择会导致成本与性能出现巨大差异。架构通过控制代码搜索、上下文管理、工具编排和测试循环等环节影响表现。Zaharia 强调,一个简单的 Pi harness 就能做到与厂商提供的 harness 相近的成功率,但成本低一半。此外,单看每 token 价格会误导决策:例如 Sonnet 5 虽然每 token 比 Opus 4.8 便宜,但在任务中消耗了更多 token,导致总成本更高且质量更低。

最优策略与工具发布

综合评测结果,目前不存在一种模型能解决所有问题,最佳的帕累托前沿(性价比最优)需要组合使用 OpenAI、Anthropic 与开源模型。为此,Databricks 推出了名为 Omnigent AI 的“元框架”,允许开发者自由切换和组合不同的 agent,以实现企业内部特定任务的最优配置。

2026-07-09 ~ 2026-07-11 · 16 条相关

一手来源