Grok 4.5 跑分亮眼但陷测试集泄露争议

Grok 4.5 在 CursorBench 基准测试中取得了亮眼成绩,以 66.7% 的得分排名第三,仅次于 Fable 5 Max 等模型。但该成绩随后因训练数据污染问题陷入争议,引发社区对其实际性能的讨论。

性价比与跑分表现

据 @XFreeze 和 @JOBhakdi 转述的测试结果,Grok 4.5 High 在 CursorBench 上表现优异,得分紧咬 70.5% 的 Fable 5 Max。更引人注目的是其成本优势:单任务成本仅为 1.51 美元。作者指出,这种高性价比主要归功于模型消耗的 token 数量更少。不过 @JOBhakdi 也强调,目前仍需更多基准测试来全面验证其实力。

训练数据污染争议

@AlyoshaV 和 @SkyLi0n 透露,Grok 4.5 在该基准上的优势部分源于“意外”。其训练集中包含了 Cursor 代码库的早期快照,这直接影响了跑分表现。官方回应称,虽然确切分数受到的影响尚不清楚,但相关数据已从未来的模型训练批次中彻底移除,后续模型不会再出现此类问题。

2026-07-09 ~ 2026-07-10 · 6 条相关

一手来源