研究揭示主流大模型评测集存在严重污染
一项最新研究对 GPQA、MMLU-Pro 和 MMMU-Pro 等多个热门大模型评测基准进行了系统审计,发现存在严重的题目污染问题。数据显示,受审查的评测集中最多有 12% 的题目存在问题。在修复这些污染问题后,模型的测试得分大幅提升,甚至逼近满分。这一发现揭示了当前主流评测体系存在的漏洞,对大模型真实能力的评估提出了严峻挑战。
2026-07-29 ~ 2026-07-29 · 2 条相关
- 审计发现 GPQA 等基准最多有 12% 题目有问题 — pawofdoom · 2026-07-29
- 研究揭示主流大模型评测集严重污染,修复后得分逼近满分 — pawofdoom · 2026-07-29