实测反转:4.6 高档跑赢 4.7,疑似针对热门榜单优化
PawelHuryn · x · 2026-09-22
博主 PawelHuryn 对 Grok 4.6 与 4.7 做多轮独立实验对比:在 high 档 4.6 以 23 比 19 胜过 4.7,4.6 的 medium 档甚至也更好;max 档 4.7 追加一轮(n=4)仅以 0.1 分反超,作者判断属随机噪音。他正在扩大各 effort 档位的实验数量,并推测 4.7 并非真的更强,而是针对流行基准做了优化。
所属事件:实测 105 个植入 bug:Grok 4.7 不敌 GPT-6,也未胜 4.6(4 条相关)→
「模型」频道最新
- 分析称 Kimi 新版小版本升级竟重做全量预训练,采用两阶段训练 — stochasticchasm · 2026-09-22
- OpenAI 模型规范新条目:承认成人模式是值得探索的方向 — borowcy · 2026-09-22
- OpenAI 内部数学模型解题引争议:研究者称学界持续低估其意义 — acoolrandomusername · 2026-09-22
- 小米 MiMo-V2.6-Pro 冲进 Code Arena 前十,开源模型排第三 — arena · 2026-09-22
- 模型续评:伦理项目比时间表更耐久 — LesaunH · 2026-09-22
- Paradigm 开源 Limite 及 Value model,MATH-500 少样本得分 59.8% — tensorqt · 2026-09-22