Surge AI 高管揭示基准测试失效内幕:成本千万美元且普遍污染

alex_verem · x · 2026-08-03

Surge AI 产品副总裁 Nick Heiner 在演讲中指出,当前的 AI 基准测试(如 SWE-bench)分数往往与现实脱节。他揭示了两个核心问题:

文章回顾了 MMLU 等测试从昔日的黄金标准沦为如今被前沿模型轻易刷榜(超 88%)的现状,强调大众需要重新审视基准分数的实际意义。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →