SWE-Bench Pro V2 Hard 上线首日被刷至 98%,迅速饱和
ScaleAI Labs 官宣 SWE-Bench Pro V2 上线并发布更新说明,但 Reddit 用户随即指出其 Hard 档在发布首日就被顶尖模型刷到接近 98% 的完成度,几乎完全饱和,已无法有效区分前沿模型的真实工程能力。X 用户也转发调侃新基准刚发布就被刷穿,反映出当前前沿模型在软件工程基准上的能力已逼近上限,基准评测面临持续失效的困境。
2026-09-23 ~ 2026-09-23 · 2 条相关
- SWE-Bench Pro V2 Hard 上线首日即被刷到 98%,基准再告饱和 — 141_1337 · 2026-09-23
- SWE-Bench Pro V2 上线即饱和,网友吐槽基准已被刷穿 — burny_tech · 2026-09-23