SWE-Bench Pro基准测试因仓库过少遭质疑

近日,AI基准测试SWE-Bench Pro的代表性在社区引发争议。有用户指出,该评测集仅包含11个代码仓库和731个任务,其中顶部仓库的任务占比高达13.1%。社区认为,在样本和覆盖面如此有限的情况下,很难据此准确评估模型的真实编程能力。

2026-07-22 ~ 2026-07-22 · 2 条相关