GLM 5.2 在企业代码评测中打平Opus
rohanpaul_ai · x · 2026-07-11
Databricks 用真实内部 PR、测试和百万行级代码库做评测,而不是只看公开基准。
结果显示:
- GLM 5.2 进入了 Databricks 的最高能力档,并且在质量上与 Claude Opus 4.8 统计上打平。
- 代码任务的“质量-成本”帕累托前沿里,既有 OpenAI、Anthropic,也有开源模型,说明当前只能靠多模型组合拿到前沿表现。
- 对同一个模型,harness/编排方式本身就能带来约 2x 的成本节省。
- Databricks 认为开源模型已经能覆盖最高难度任务,并在前面用 Omnigent 做多 harness、多模型路由。
所属事件:Databricks发布企业内部代码基准,架构比模型更影响成本(16 条相关)→
「编程与Agent」频道最新
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11