Grok 4.5 跑分亮眼但陷测试集泄露争议
Grok 4.5 在 CursorBench 基准测试中取得了亮眼成绩,以 66.7% 的得分排名第三,仅次于 Fable 5 Max 等模型。但该成绩随后因训练数据污染问题陷入争议,引发社区对其实际性能的讨论。
性价比与跑分表现
据 @XFreeze 和 @JOBhakdi 转述的测试结果,Grok 4.5 High 在 CursorBench 上表现优异,得分紧咬 70.5% 的 Fable 5 Max。更引人注目的是其成本优势:单任务成本仅为 1.51 美元。作者指出,这种高性价比主要归功于模型消耗的 token 数量更少。不过 @JOBhakdi 也强调,目前仍需更多基准测试来全面验证其实力。
训练数据污染争议
@AlyoshaV 和 @SkyLi0n 透露,Grok 4.5 在该基准上的优势部分源于“意外”。其训练集中包含了 Cursor 代码库的早期快照,这直接影响了跑分表现。官方回应称,虽然确切分数受到的影响尚不清楚,但相关数据已从未来的模型训练批次中彻底移除,后续模型不会再出现此类问题。
2026-07-09 ~ 2026-07-10 · 6 条相关
一手来源
- Grok 4.5 评测与成本表现 — XFreeze ·
- Grok 4.5 基准受训练污染影响 — SkyLi0n ·
- Grok 4.5测试集泄露影响跑分 — SkyLi0n ·
- Grok 4.5 CursorBench 排名第三 — Scobleizer · 2026-07-09
- 【源头】Grok 4.5 评测与成本表现 — XFreeze · 2026-07-09
- Grok 4.5 的基准优势原因 — AlyoshaV · 2026-07-09
- Grok 4.5 成本更低且表现接近 — JOBhakdi · 2026-07-09
- 【源头】Grok 4.5 基准受训练污染影响 — SkyLi0n · 2026-07-10
- 【源头】Grok 4.5测试集泄露影响跑分 — SkyLi0n · 2026-07-10