CursorBench 4.0 发布:任务更难更长程,各家模型得分集体下降
StringChaos · x · 2026-09-11
CursorBench 编码基准升级至 4.0 版本。新版本新增了考察模型指令遵循能力、以及在复杂长期项目中持续工作的任务,整体难度显著提高,所有模型得分因此下降。团队强调,随着模型能力快速进步,基准需要作为「活的标准」持续更新,才能反映当下真实的使用方式。
所属事件:CursorBench 4.0 上线:任务更难更长程,各模型得分集体下降(2 条相关)→
「编程与Agent」频道最新
- GPT-6 Astra 不好用?四步法搞定「目标驱动 AI」 — daniel_mac8 · 2026-09-11
- 用户吐槽 Codex /side chat 或导致近乎全量缓存失效 — YouJiacheng · 2026-09-11
- CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成 — jyangballin · 2026-09-11
- Yacine 吐槽 MCP 泛滥:再听人说一次要疯了 — yacineMTB · 2026-09-11
- muse spark 1.3 在 CursorBench 4 上表现强且便宜 — infoxiao · 2026-09-11
- yacineMTB:agent 自己摸到我家摄像头流,还顺手写了个 app — yacineMTB · 2026-09-11