CursorBench 4.0 上线:任务更难更长程,各模型得分集体下降

编码基准 CursorBench 升级至 4.0 版本,新增考察模型指令遵循能力以及在复杂长期项目中持续工作的新任务,整体难度显著提高。由于任务更长程、更苛刻,各模型在新版本下的得分普遍下降。此外,帖中还提到 Muse Spark 1.3 性能追平 Sol 而价格不到其四成,显示出竞争模型在性价比上的新动态。团队强调,随着模型能力提升,基准也需持续进化以保持区分度。

2026-09-11 ~ 2026-09-11 · 2 条相关