SWE-Bench Pro基准测试因仓库过少遭质疑
近日,AI基准测试SWE-Bench Pro的代表性在社区引发争议。有用户指出,该评测集仅包含11个代码仓库和731个任务,其中顶部仓库的任务占比高达13.1%。社区认为,在样本和覆盖面如此有限的情况下,很难据此准确评估模型的真实编程能力。
2026-07-22 ~ 2026-07-22 · 2 条相关
- SWE-Bench Pro 只有 11 个仓库,代表性遭质疑 — ZainHasan6 · 2026-07-22
- SWE-Bench Pro 被吐槽:11 个 repo 却有 731 个任务 — ZainHasan6 · 2026-07-22