研究揭示主流大模型评测集严重污染,修复后得分逼近满分
pawofdoom · reddit · 2026-07-29
一位研究者在审查主流大模型评测基准时发现,GPQA、MMLU-Pro 和 MMMU-Pro 等基准测试中存在严重的题目污染问题。
- 数据触目惊心:在受审查的评测集中,约有 12% 的题目存在错误,包括题目格式损坏、官方答案错误,或存在多个现实可行的答案。
- 模型真实表现:此前顶级模型在 GPQA-Diamond 上的得分普遍卡在 92-93% 左右,研究者怀疑正是这些错题导致了天花板。在使用修复后的“干净版”数据集进行测试时,顶级模型的得分直接飙升至 98%。
- 开源资源:研究者已发布了包含修复后数据集和详细错误标记账目的完整论文,并提供了适配 lm-eval-harness 的任务和 Hugging Face 数据集。
所属事件:研究揭示主流大模型评测集存在严重污染(2 条相关)→
「模型」频道最新
- 老 Web 开发者称 Claude Opus 4.8 和 5 聊天已难用 — FuzzyHead455 · 2026-07-29
- 用户称 Gemini Pro 付费后仍被分流到其他模型 — IAmMonke2 · 2026-07-29
- Reddit 争论 Hugging Face/OpenAI “AI hack” 是否可信 — callme_e · 2026-07-29
- 一组假 Claude 截图把“模型福利”写成了 AI 圈名场面 — repligate · 2026-07-29
- ChatGPT 安卓版疑似把模型切换改成 effort 等级 — justanothergin · 2026-07-29
- 伪造 Claude 截图变成超立方体纠错梗图 — repligate · 2026-07-29