SWE-Bench Pro V2 上线即饱和,网友吐槽基准已被刷穿
burny_tech · x · 2026-09-23
ScaleAI Labs 官宣 SWE-Bench Pro V2 上线并发布更新说明,但 X 用户转发调侃:新基准刚发布就已经被模型刷到饱和——反映当前前沿模型在软件工程基准上的能力已远超基准设计速度,基准更新的意义在于维持区分度而非拉开差距。
所属事件:SWE-Bench Pro V2 Hard 上线首日被刷至 98%,迅速饱和(2 条相关)→
「模型」频道最新
- LIBERO 实测:GPT-6 各版本推理越强,机器人操作越好 — YuXiang_IRVL · 2026-09-23
- 有人认为 Jev 过热,Diffusion Gemma 才是被低估的真 System-1 — bingxu_ · 2026-09-23
- Opus 5.5 在 Blender 里逐根建模发丝,能力演示惊艳 — majidmanzarpour · 2026-09-23
- Opus 5.5 上线 Perplexity:额度慷慨,导入 skills 自动查 prompt injection — ChrisUniverse · 2026-09-23
- Brundage 玩梗「YouTube Poop 基准」,暗示新模型评测提升 — Miles_Brundage · 2026-09-23
- 机器人任务实测:GPT-6 推理越强操作越好,成本差 30 倍 — YuXiang_IRVL · 2026-09-23