Grok 4.7 编码评测大涨:CursorBench 40.4%→46.3%,价格不变
FinanceYF5 · x · 2026-09-22
对比 Grok 4.7 与 4.6 制作的开放世界城市游戏 Demo,4.7 能持续工作更久、验证更充分、成品质量更好。
评测成绩:
- CursorBench:40.4% → 46.3%
- EEBench:53% → 64%
价格维持不变:输入 2 美元/百万 tokens,输出 6 美元/百万 tokens。
所属事件:Grok 4.7 评测:智能指数 46 分进前四,token 消耗翻倍引争议(15 条相关)→
「编程与Agent」频道最新
- 谷歌开源 ARTEMIS:AI 像人一样操作安卓真机,每步最快 3 秒 — aigclink · 2026-09-22
- 开源无限后室游戏 vackrooms:全程用 Claude 写成 — pablostanley · 2026-09-22
- 给 LLM 建代码库 Wiki,实测输入 token 减半 — kedar5 · 2026-09-22
- 开发者实测:Claude Code Projects 是并行干重活的最佳界面 — daniel_mac8 · 2026-09-22
- 开源项目 QM 发布 v0.1.12:Agent 集群进入 Beta — ycombinator · 2026-09-22
- 类别感知专家训练框架:SWE-bench Multilingual 达 59% — Logics-MLLM · 2026-09-22