Are We Done with MMLU?
Aryo Pradipta Gema, Joshua Ong Jun Leang, Giwon Hong, Alessio Devoto, Alberto Carlo Maria Mancino, Rohit Saxena, Xuanli He, Yu Zhao, Xiaotang Du, Mohammad Reza Ghasemi Madani, Claire Barale, Robert McHardy, Joshua Harris, Jean Kaddour, Emile van Krieken, Pasquale Minervini
cs.CL, cs.AI
2024-06-06
爱丁堡14名专家按判定树重标57科各100题,分层估计MMLU全库6.49%有错;病毒学脏题57%,去掉后Llama 3.1 405B从第16升到第1,自动查错F2最高44.75。
MMLU 是 Hendrycks 等人 2021 年做的 57 科四选一基准,题从公开教材、AP/GRE/CPA 试卷和网测题抠出来,几乎每篇 LLM 报告都会报。题是人标的,流程几乎没文档。错题一直有人在博客和视频里零散点名,没有人按科目把错误类型数清楚。
标错的题会把「模型不会」和「标准答案本身是错的」搅在一起。病毒学子集有一道防疫题,MMLU 给的答案是派欧美军队进西非;教材原题给的是重建医疗体系和培训人员。这种题对上了官方标签,也不知道模型到底懂不懂病毒学。
爱丁堡大学牵头,14 名领域专家按一棵判定树给每道题打标,不直接改答案。判定顺序如下:
五类叶子错误:题干不清、选项不清、没有正确答案、多个正确答案、ground truth 标错。57 个科目各随机抽 100 题,共 5700 题,构成 MMLU-Redux。能找回源教材或试卷的,按源核对。标注者给出的正确选项目前没有写回 MMLU 标签。
全库 14042 题,用各科原始题量做分层估计。五科脏数据上三人交叉标,Cohen's Kappa 在 0.64 到 0.96。
他们再拿 HELM 榜上的模型,分别在「整科原题」和「MMLU-Redux 里核过没问题的题」上算 exact match,看排名动不动。另一条线是自动找错:zero-shot、few-shot、CoT,用 BM25 从 Wikipedia 和 MS MARCO 检索 5 段再问模型,以及用人造脏数据 LabelChaos(约 26.4 万条,按同样五类错误腐化)微调 Llama-3-8B-Instruct。
分层估计全库 6.49% 有错。错误构成大约是题干不清 2.47%、多正确答案 1.54%、ground truth 标错 1.42%、没有正确答案 0.62%、选项不清 0.44%。脏科目和干净科目差一个数量级。
| 科目 | 100 题里没问题 | 主要错误 |
| Virology | 43 | ground truth 标错 33 题 |
| Logical Fallacies | 74 | 题干不清 14 题 |
| College Chemistry | 75 | ground truth 标错 21 题 |
| Professional Law | 82 | 多正确答案 11 题 |
| Management 等 9 科 | 100 | 抽到的 100 题全干净 |
病毒学大量错标来自 Human Virology 教材题库解析失败;大学化学有跨行题被切碎、原 E 选项被丢掉;形式逻辑把 (F∧L)∧¬C 和 F∧L∧¬C 判成一个对一个错;职业法律默认美国法域却不写明。Global Facts 几乎每题都要外查,Our World in Data 和 Transparency International 对同一道埃塞俄比亚腐败题给过相反证据。
排名会翻。病毒学上 Llama 3.1 Instruct Turbo 405B 按 HELM 整科成绩排第 16(exact match 0.57),只看核过的干净题升到第 1(0.93)。Human Sexuality 上 GPT-4 (0613) 从第 5(0.91)掉到这十个模型里最后(0.43);Gemini 1.5 Pro 同科从第 55(0.37)升到第 6(0.94)。职业法律和形式逻辑上,模型在错题上的 exact match 并不低于干净题,论文把这读成预训练背过原题。
自动找错目前扛不住。Claude 3 Opus 的 few-shot CoT 是提示词线最好的,Recall 48.85、F2 40.29。加上 RAG 之后 Recall 能到 83.91,F2 只到 41.92,多半是误报堆上去的。合成脏数据上微调的 Llama-3-8B,F2 44.75、Recall 56.58,仍然远不够用来自动洗库。
谁还在用 MMLU 做卖点或消融,这 6.49% 不是边角料。病毒学、大学化学这种小科,错题占比高到能单独改写名次;职业法律这种大科,抽样错误率 18% 乘上 1534 题,会把加权全库错误率往上拽。
MMLU-Redux 现在能做的是:评测时丢掉已标错的题,或者拿它当「数据集查错」的测试集。它还不是一份改好答案的新 MMLU。并跑的 MMLU-Pro 从原库筛过、加过题,原错仍在。
自动洗不干净。Claude 把 Recall 拉到 80% 以上的代价是精确率垮掉;8B 微调也只把 F2 推到 44.75。要洗全库,仍然得进人。
5700 题只覆盖全库 14042 题里的一部分,剩下 8342 题没标。分层 6.49% 依赖「每科 100 题的错误率能代表该科」这一条,职业法律、Miscellaneous 这种大科尤其敏感。
标注协议仍吃个人判断:题干算不算缺上下文、法律题算不算多个可成立答案,Kappa 在 Human Sexuality 只有 0.64。论文承认协议挡不住标注者偏见。
Table 2 左右两列不是同一套评测。左边是 HELM 整科分数,右边是 MMLU-Redux 干净子集,提示词和题量都可能不同,绝对分数不宜直接相减,能站得住的是名次移动。
标注者给出的正确选项没有写回标签,所以「在干净题上重测」丢掉了错题,并没有把错题改对再测。职业法律和形式逻辑上「错题反而更准」只是间接的背题嫌疑,没有训练数据成员推断实验。