Grok 4.7 多次评测仅胜 4.6 0.1 分,作者判定属随机噪声

PawelHuryn · x · 2026-09-22

Pawel Huryn 对 Grok 4.7 (max) 与 4.6 (max) 在一批 2026 年初前沿模型未解的难题上做了多轮评测:4.7 第四次运行仅领先 0.1 分,判定为随机噪声,停止该难度档测试。此前 xhigh 档三次运行结果为 4.6:27/30/29,4.7:25/30/31,方差不大,但均未超过 Muse Spark 1.3 的中位数。注:测试题是前沿模型当时未解的真实难题而非植入 bug;OpenAI 模型会主动报告大量真实但无关的理论问题,故未计入未植入 bug。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →