代码评测多是夹带私货的糊分数,开发者呼吁按领域细分 benchmark
almmaasoglu · x · 2026-09-23
开发者 Alm Maasoglu 指出,当前代码类 benchmark 大多是“slop”——它们把差异极大的工作负载压缩成一个总分,掩盖了真实能力差异。
他主张按细分领域建立更窄的评测:科研代码、后端 API、数据库系统、基础设施、调试、仓库级大改动等。“擅长写代码”本身不是一个有用的能力类别,呼吁有人来修复这一评测体系。这一观点回应了社区对现有 SWE 类榜单区分度不足的普遍不满。
「模型」频道最新
- Anthropic 发布 Claude Opus 5.5:性能追平 Fable 5.1,成本低 40% — aigclink · 2026-09-23
- 重度使用 Opus 5.5 一整天,用量额度几乎没见底 — altryne · 2026-09-23
- 观点:十年前的专家看到今天模型会宣称 AGI 已实现 — JacksonKernion · 2026-09-23
- 为省额度折腾模型切换:Reddit 用户称便宜 swarm 模型组合效果不错 — AnotherWallace · 2026-09-23
- 用户吐槽 Anthropic 新模型:自动路由到 fable、仍锁定 cyber — BLUECOW009 · 2026-09-23
- 爆料:Qwen4-35B-A3B 已在测试,尚未官宣 — AIFlow_ML · 2026-09-23