CursorBench 4.0 榜单:Grok 4.7 得分 46.3% 且每任务仅 6 美元居性价比之首
haider1 · x · 2026-09-22
haider 分享 CursorBench 4.0 编程基准结果:Grok 4.7 xhigh 得分 46.3%、每任务成本 $6.01;Fable 5.1 medium 46.8%、$7.05;GPT-5.6 sol max 41.7%、$8.23。相比 Grok 4.6 xhigh 的 41.4%,新版本在成本几乎不变的情况下提升至 46.3%,性价比提升明显。
「模型」频道最新
- 安全护栏毁了叙事:视频模型画面如电影,打斗戏却集体「退缩」 — CurieuxExplorer · 2026-09-22
- 基于 Qwen3.8-27B 的写作微调模型 Hemmingway-1 上架 Hugging Face — CurieuxExplorer · 2026-09-22
- GPT-6 Astra 多次把模拟人物推下悬崖,Grok/Gemini/Claude 都拒绝了 — CurieuxExplorer · 2026-09-22
- 用户抱怨 Codex 额度遭缩水式下调:还能信大厂吗 — StewartalsopIII · 2026-09-22
- 博弈论视角:抢在对手发布日前一天发模型等于自认更弱? — cocktailpeanut · 2026-09-22
- LFM2.5 端侧评测登顶:2.32GB 内存、8 秒延迟,39 款小模型中并列第一 — maximelabonne · 2026-09-22