独立测试:Grok 4.7 中等推理反超高档,疑为刷榜优化

PawelHuryn · x · 2026-09-22

作者 PawelHuryn 公布独立测试结果:Grok 4.7 (medium) 稳定跑赢 (high) 甚至 (xhigh)(medium 三次 30/23/27,xhigh 四次 25/30/31/29,high 仅 19/22/17,low 11/15)。此外 Grok 4.6 (high) 得 23 分,反超 4.7 (high) 的 19 分,4.6 (medium) 也更高。作者正在增加各 effort 档位的实验次数,但认为这更像是给 4.7 机会追赶。他怀疑 4.7 并未修复问题,只是针对热门 benchmark 做了优化。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →