Surge AI 高管揭示基准测试失效内幕:成本千万美元且普遍污染
alex_verem · x · 2026-08-03
Surge AI 产品副总裁 Nick Heiner 在演讲中指出,当前的 AI 基准测试(如 SWE-bench)分数往往与现实脱节。他揭示了两个核心问题:
- 构建成本极高:一个包含 1000 个任务的严肃基准测试需要耗费约 1500 万美元。因为每个任务需 60 小时构建,按工程师年薪 50 万美元计算,预算超出了多数团队的承受力,迫使项目偷工减料。
- 数据污染成常态:模型在训练中已经记住了测试集。例如,只需给 Claude Opus 提示词的前半部分,它就能逐字背出 SWE-bench Verified 中的剩余内容甚至答案。
文章回顾了 MMLU 等测试从昔日的黄金标准沦为如今被前沿模型轻易刷榜(超 88%)的现状,强调大众需要重新审视基准分数的实际意义。
「模型」频道最新
- Kimi K3 开源被指藏商业限制,规模化需签 Moonshot 协议 — BenBajarin · 2026-08-03
- 大佬吐槽X端情绪极端化:开源小模型远不及闭源前沿 — bindureddy · 2026-08-03
- Anthropic 工程师:模型与工具链深度绑定才能榨干性能 — May_F1_ · 2026-08-03
- 这三个模型有什么区别? — Clair_Personality · 2026-08-03
- Minimax H3的蒸馏LoRA何时发布? — Character_Title_876 · 2026-08-03
- OpenAI 性价比提升,作者归功于国产大模型施压 — haider1 · 2026-08-03