MMLU 基准约 6.5% 题目有错,57% 病毒学子集被人工标注出问题
PMinervini · x · 2026-09-19
PMinervini 向 Epoch AI 推荐 MMLU-Redux 论文(arXiv:2406.04127)。研究团队人工重标注 MMLU 题目,发现大量 ground truth 错误:
- 估计 6.49% 的 MMLU 题目含错误;Virology 子集中错误率高达 57%
- 提出系统的数据集错误标注协议,构建覆盖全部 57 个学科的 5,700 道人工重标注题目的 MMLU-Redux
- 用 MMLU-Redux 重新评测发现与原报告的模型成绩存在显著差异
作者呼吁修订 MMLU 中的错误题目,以恢复其作为基准的可靠性。
所属事件:研究发现 MMLU 基准约 6.5% 题目标注有误(2 条相关)→
「模型」频道最新
- Kimi 官方发神秘谜题,解码为 π 疑暗示 K3.1 将至 — kimmonismus · 2026-09-19
- 好名字也是竞争力:BERT 与 Jev 走红背后的命名效应 — IgorCarron · 2026-09-19
- SuperGrok Heavy 附赠 Cursor Ultra 额度暗砍 75%:$400 降至 $100 — mazzaTalk · 2026-09-19
- 4 张 RTX 3090 服务器选型:继续跑 Qwen 27B 还是上 Next Flash — Zyj · 2026-09-19
- 企业级开发实测:主流基准跑分与真实任务严重错配 — DivideHorror3217 · 2026-09-19
- 社区涌现近20个 openjev 模型,爱好者自费建榜今发首个排行榜 — airesearch12 · 2026-09-19