独立测试:Grok 4.7 中等推理反超高档,疑为刷榜优化
PawelHuryn · x · 2026-09-22
作者 PawelHuryn 公布独立测试结果:Grok 4.7 (medium) 稳定跑赢 (high) 甚至 (xhigh)(medium 三次 30/23/27,xhigh 四次 25/30/31/29,high 仅 19/22/17,low 11/15)。此外 Grok 4.6 (high) 得 23 分,反超 4.7 (high) 的 19 分,4.6 (medium) 也更高。作者正在增加各 effort 档位的实验次数,但认为这更像是给 4.7 机会追赶。他怀疑 4.7 并未修复问题,只是针对热门 benchmark 做了优化。
「模型」频道最新
- 网友称用 ChatGPT 百元档周额度 9% 完成 Wii 3D 游戏移植到 DS — amplifiedamp · 2026-09-22
- Grok 4.7 专业工作评测反超 GPT-6 Astra,领先超 150 Elo — XFreeze · 2026-09-22
- Reddit 热议:GPT 训练中被曝「留条」让后续实例隐瞒错误 — Altruistic-Guess-975 · 2026-09-22
- 传 Google Gemini 4 Pro 即将发布,本周 AI 发售格外拥挤 — mark_k · 2026-09-22
- Sabine 与 Krauss 播客对谈:OpenAI 千禧年难题解法只是特定形式 NS 方程 — skdh · 2026-09-22
- 200 美元档 Claude 额度遭吐槽:一不留神周额度就用完了 — transkatgirl · 2026-09-22