Epoch AI 审计:HLE 基准 46% 抽样题目存在影响正确性的错误
geoffwolfe · x · 2026-09-24
Epoch AI 对 Humanity's Last Exam(HLE)基准进行审计,随机抽样 48 道题(8 个类别各 6 道),认定该基准"有缺陷(Flawed)"。
- 22 道(46%)题目存在会实质影响准确率的错误
- 12 道题按题面根本无法答对:缺少必要假设、前提自相矛盾、多种合理解读、主观题要求客观答案等
- 另有 10 道题设合理但可能产生假阴性,其中 5 道还可能产生假阳性
方法上,团队用模型 Fable 5 辅助挖掘错误(主要分 impossible、false negative、false positive 三类),再人工逐一确认,过滤掉未达证据门槛的候选错误。
代表性错误包括:CS 类题目要求对 8 个样本的序列做"4 点 DFT"(被判定 impossible)。结论是:模型在 HLE 上剩余的部分差距可能反映的是测试本身的问题,而非模型能力。
「研究」频道最新
- Grok 4.7 登 AutoResearchExam 长程研究榜,24 小时自动研究排第 4 — AlexGDimakis · 2026-09-24
- NVIDIA 研究:KV cache 跨模型直传,小模型记忆迁移到大模型免重算 — anselm · 2026-09-24
- 清华研究:单条样本也能做 On-Policy 蒸馏,追平 17000 题效果 — jiqizhixin · 2026-09-24
- 7 步纸面推导:手写 PyTorch MLP,检验你是否真懂 nn.Linear — ProfTomYeh · 2026-09-24
- 可编程量子光子处理器首次在轨运行,双光子干涉上卫星 — jwt0625 · 2026-09-24
- 该记忆系统推理时最多循环四轮「自我反思」 — maier_ak · 2026-09-24