研究发现 MMLU 基准约 6.5% 题目标注有误
PMinervini 等人的论文《Are We Done with MMLU?》(arXiv:2406.04127)对流行基准 MMLU 的标注质量进行了系统的人工重标注分析。研究发现约 6.5% 的题目 ground truth 存在错误,其中病毒学子集问题最为严重,错误率高达 57%。该结果由 PMinervini 推荐给 Epoch AI,提示基于 MMLU 的模型评估结果可能需要重新审视。
2026-09-19 ~ 2026-09-19 · 2 条相关
- MMLU 基准约 6.5% 题目有错,57% 病毒学子集被人工标注出问题 — PMinervini · 2026-09-19
另有 1 条近重复转述:PMinervini