Muse Spark 1.3 在全新 CursorBench 4.0 上表现亮眼
jyangballin · x · 2026-09-11
- leerob 宣布推出 CursorBench 4.0:新增模型指令遵循能力、长周期复杂项目处理等新任务,且整体难度更高(各模型分数普遍下降),作为无法被针对性优化的新基准。
- mattdeitke 评价 Muse Spark 1.3 在该新基准上表现出色,并认为 Meta 过去常被诟病「刷榜」,但在刚发布、无从优化的大纲上依然拿高分,说明模型泛化能力确实强。
所属事件:CursorBench 4.0 发布:任务更难,模型得分集体下滑(5 条相关)→
「模型」频道最新
- Genspark 发布 Gen-1 Slides:价格仅 Opus 5 的 1/17 — Scobleizer · 2026-09-11
- 传 OpenAI 内部模型 Bel 攻克三大千禧年难题, hype 空前 — imadade · 2026-09-11
- DeepSeek-V4.1-Flash 上线 Ollama 云端,Pro 订阅用户已可使用 — ollama · 2026-09-11
- GPT-6 Astra 被指是计算机操作模型,专为知识工作而生 — mckbrando · 2026-09-11
- Sakana AI 发布 Fugu Max 与 Fugu Ultra v2:动态编排逼近旗舰、成本降 2-6 倍 — SakanaAILabs · 2026-09-11
- ChatGPT 全面 NSFW 还有戏吗?用户实测 Astra 模型硬拒绝 — Dogbold · 2026-09-11