代码评测多是夹带私货的糊分数,开发者呼吁按领域细分 benchmark

almmaasoglu · x · 2026-09-23

开发者 Alm Maasoglu 指出,当前代码类 benchmark 大多是“slop”——它们把差异极大的工作负载压缩成一个总分,掩盖了真实能力差异。

他主张按细分领域建立更窄的评测:科研代码、后端 API、数据库系统、基础设施、调试、仓库级大改动等。“擅长写代码”本身不是一个有用的能力类别,呼吁有人来修复这一评测体系。这一观点回应了社区对现有 SWE 类榜单区分度不足的普遍不满。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →