主流编程基准严重偏向特性实现和修 Bug
heypearlai · x · 2026-07-24
主流编程基准里的任务分布
配图把常见 coding benchmark 的任务拆成了多个类别,包括特性实现、Bug 修复、按规格实现算法、旧代码迁移/逆向、性能优化、代码库问答、重构、机器学习与数据管线、安全审计,以及环境/构建/运维。
关键结论
- 特性实现占比最高,达到 30.0%。
- Bug 修复紧随其后,占 28.5%。
- 按规格实现算法占 13.0%。
- 旧代码迁移与逆向工程也有 9.3%,不是小众任务。
- 其余类别还包括性能优化、代码理解与 QA、重构、ML/Data 管线、安全审计、构建/运维和参考数据维护。
图中同时标出了各类别的主要来源基准,例如 SWE-Bench Pro、KernelBench、DeepSWE、LiveBench、SciCode、MLS-Bench 等。
所属事件:主流编程基准任务类型单一,Terminal-Bench覆盖更全(3 条相关)→
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11