实测反转:4.6 高档跑赢 4.7,疑似针对热门榜单优化

PawelHuryn · x · 2026-09-22

博主 PawelHuryn 对 Grok 4.6 与 4.7 做多轮独立实验对比:在 high 档 4.6 以 23 比 19 胜过 4.7,4.6 的 medium 档甚至也更好;max 档 4.7 追加一轮(n=4)仅以 0.1 分反超,作者判断属随机噪音。他正在扩大各 effort 档位的实验数量,并推测 4.7 并非真的更强,而是针对流行基准做了优化。

所属事件:实测 105 个植入 bug:Grok 4.7 不敌 GPT-6,也未胜 4.6(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →