SWE-Bench Pro V2 Hard 上线首日被刷至 98%,迅速饱和

ScaleAI Labs 官宣 SWE-Bench Pro V2 上线并发布更新说明,但 Reddit 用户随即指出其 Hard 档在发布首日就被顶尖模型刷到接近 98% 的完成度,几乎完全饱和,已无法有效区分前沿模型的真实工程能力。X 用户也转发调侃新基准刚发布就被刷穿,反映出当前前沿模型在软件工程基准上的能力已逼近上限,基准评测面临持续失效的困境。

2026-09-23 ~ 2026-09-23 · 2 条相关