MMLU 约 6.5% 题目有错,病毒学子集错误率高达 57%
PMinervini · x · 2026-09-19
PMinervini 等人的论文《Are We Done with MMLU?》(arXiv:2406.04127)系统分析了流行基准 MMLU 的标注质量。
核心发现:
- 人工分析显示 MMLU 存在大量 ground truth 错误,整体估计约 6.49% 的题目有错;其中病毒学(Virology)子集最严重,57% 的被分析题目含错。
- 团队提出一套新的错误标注协议框架,并据此构建 MMLU-Redux:覆盖全部 57 个学科的 5700 道人工重标注题目。
- 用 MMLU-Redux 重新评测显示,与原始报告的模型成绩存在显著差异,说明被污染的题目掩盖了 LLM 的真实能力。
- 作者呼吁修订 MMLU 中的错误题目,以恢复其作为基准的可靠性。
所属事件:研究发现 MMLU 基准约 6.5% 题目标注有误(2 条相关)→
「模型」频道最新
- Vercel 网关开源模型 token 占比创纪录达 78.4% — charles_irl · 2026-09-19
- 用户抱怨 Cursor 频繁强制切到 Grok,考虑转投 Claude Code — gaganghotra_ · 2026-09-19
- OpenAI 联创闭门造 Jev 三年,开源版三天就实现了反超 — gaganghotra_ · 2026-09-19
- Benchmaxxing 警报:刷榜满分模型真实任务表现平平 — airesearch12 · 2026-09-19
- GitHub 测试文件现 MiniMax M3.1 痕迹,新模型或已在路上 — Nunki08 · 2026-09-19
- Kimi 官方发神秘谜题,解码为 π 疑暗示 K3.1 将至 — kimmonismus · 2026-09-19