Cursor 公布 CursorBench 编码榜单:Fable 5.1 Max 以 73.4% 居首
mattyp · x · 2026-09-03
Cursor 发布 CursorBench 3.2 编码 agent 排行榜,基于真实 Cursor 会话中的模糊多文件任务评估各模型 agent。要点:
- 榜首:Fable 5.1 Max 得分 73.4%,单任务成本 $9.64;Fable 5.1 Extra High 以 72.8%、$6.95/任务紧随其后。
- 性价比:Grok 4.6 Extra High 以 70.8% 得分、仅 $2.81/任务颇具性价比;GPT-5.6 Luna Max 得分 61.1% 但成本低至 $0.39/任务。
- 高价档:Fable 5 Max 得分 70.5% 但单任务成本高达 $17.32,Opus 5 Max 70.0%、$8.23。
- 榜单同时给出各配置的 token 用量与步数,可横向对比「能力—成本—效率」三角。
所属事件:Cursor 发布 CursorBench 3.2,Fable 5.1 登顶 Grok 紧随(4 条相关)→
「模型」频道最新
- Baseten 上线 GLM-5.3 Fast:开源权重强模型提速,面向实时场景 — baseten · 2026-09-03
- 多位用户反馈 Claude 近期错误频出,幻觉问题成日常 — lilyraynyc · 2026-09-03
- 首次实测 Gemini 3.8 Flash 翻车:一直思考直到超时 — rickasaurus · 2026-09-03
- 用户反馈:fable 5 好用程度胜过 fable 5.1 — BLUECOW009 · 2026-09-03
- 用户实测 Flash 3.8:能力出色但会陷入静默死循环烧 token — brandon_galang · 2026-09-03
- 用户吐槽 Claude Max 20x 限额不清:周限额才是真瓶颈,发帖被删 — conorearly · 2026-09-03