CursorBench 4.0 上线:Muse Spark 1.3 性能追平 Sol,价格不到四成
jyangballin · x · 2026-09-11
leerob 宣布 CursorBench 升级到 4.0 版本:新增考察模型指令遵循、长期在复杂项目中工作的新任务,整体难度提高(各模型得分普遍下降)。随后 claireszhou 引用该消息并给出了一个亮点数据:在新榜单上,Muse Spark 1.3 的性能与 Sol 持平,但成本不到其 40%,且这还是标准档定价而非贡献者优惠价——若按贡献者定价,性价比差距会更大。
所属事件:CursorBench 4.0 上线:任务更难更长程,各模型得分集体下降(2 条相关)→
「编程与Agent」频道最新
- Bezalel 一站式 Agent 工具平台上线:一个 MCP URL 加一个 token 接入 7 项能力 — Rasmic · 2026-09-11
- 三年生产级 Agent 实战复盘:十条昂贵教训 — garrytan · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Shopify CEO 力赞单开发者开源 Agent 框架 Pi — aakashgupta · 2026-09-11
- 开发者实战:MCP 让调试像对话一样自然,工具 API 视角解析 — zeeg · 2026-09-11
- Meta 公开 Muse 个人智能体安全架构:Sentinel 拦截与人在环审批 — altryne · 2026-09-11