审计发现 GPQA 等基准最多有 12% 题目有问题

pawofdoom · reddit · 2026-07-29

审计发现 GPQA、MMLU-Pro、MMMU-Pro 最多有 12% 题目有问题

这条 Reddit 指向一篇论文和代码仓库,作者对多个热门基准做了系统审计,检查题目是否格式错误、答案键是否有误、以及是否存在多个合理答案。结果显示,在 GPQA-Extended、MMLU-Pro 和 MMMU-Pro 里,大约有 12% 的题目可以被明确判定为有问题。

把坏题移除后,清洗版上的顶级模型分数据称能升到约 98%,而原始版本常卡在 90% 出头。作者还一并发布了 -Clean 版本基准、完整的标注清单、原版与清洗版双评分、lm-eval-harness 任务以及 Hugging Face 数据集。

所属事件:研究揭示主流大模型评测集存在严重污染(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →