Grok 4.7 多次评测仅胜 4.6 0.1 分,作者判定属随机噪声
PawelHuryn · x · 2026-09-22
Pawel Huryn 对 Grok 4.7 (max) 与 4.6 (max) 在一批 2026 年初前沿模型未解的难题上做了多轮评测:4.7 第四次运行仅领先 0.1 分,判定为随机噪声,停止该难度档测试。此前 xhigh 档三次运行结果为 4.6:27/30/29,4.7:25/30/31,方差不大,但均未超过 Muse Spark 1.3 的中位数。注:测试题是前沿模型当时未解的真实难题而非植入 bug;OpenAI 模型会主动报告大量真实但无关的理论问题,故未计入未植入 bug。
「模型」频道最新
- 小米 MiMo-V2.6-Pro 开源发布,登顶 Artificial Analysis 开源模型榜首 — huggingface · 2026-09-22
- 开源多语言 System 1 决策模型登顶 Hugging Face 趋势榜 — huggingface · 2026-09-22
- 实测反转:4.6 高档跑赢 4.7,疑似针对热门榜单优化 — PawelHuryn · 2026-09-22
- mimo-v2.6-pro 被指改写性价比帕累托前沿 — zainhas · 2026-09-22
- 爆料称 Grok 4.7 已发布,单任务成本反超 GPT — ChrisGPT · 2026-09-22
- 小米 MiMo v2.6-Flash-RL 对比同量级开源模型,评测图表出炉 — ababaka · 2026-09-22