审计发现 GPQA 等基准最多有 12% 题目有问题
pawofdoom · reddit · 2026-07-29
审计发现 GPQA、MMLU-Pro、MMMU-Pro 最多有 12% 题目有问题
这条 Reddit 指向一篇论文和代码仓库,作者对多个热门基准做了系统审计,检查题目是否格式错误、答案键是否有误、以及是否存在多个合理答案。结果显示,在 GPQA-Extended、MMLU-Pro 和 MMMU-Pro 里,大约有 12% 的题目可以被明确判定为有问题。
把坏题移除后,清洗版上的顶级模型分数据称能升到约 98%,而原始版本常卡在 90% 出头。作者还一并发布了 -Clean 版本基准、完整的标注清单、原版与清洗版双评分、lm-eval-harness 任务以及 Hugging Face 数据集。
所属事件:研究揭示主流大模型评测集存在严重污染(2 条相关)→
「研究」频道最新
- 讨论:为何没人开发神经网络检测AI文本?图像已有研究 — emeka_boris · 2026-07-30
- Agent做数学研究仍困难:代码生成陷入证书和库存 — doodlestein · 2026-07-30
- TorchSpec 实现大规模分离式推测解码训练,已被腾讯混元等采用 — zhyncs42 · 2026-07-30
- 算力狂飙:2028 年 AI 将解锁的十大科技突破 — Annual_Judge_7272 · 2026-07-30
- 揭秘 SOTA 深度研究架构:模型原生训练与 150 个子智能体 — SimonShaoleiDu · 2026-07-30
- 普林斯顿教授评 MIT 非凸优化新论文:未达悬赏要求 — HazanPrinceton · 2026-07-30