Epoch AI 审计:HLE 基准 46% 抽样题目存在影响正确性的错误

geoffwolfe · x · 2026-09-24

Epoch AI 对 Humanity's Last Exam(HLE)基准进行审计,随机抽样 48 道题(8 个类别各 6 道),认定该基准"有缺陷(Flawed)"。

方法上,团队用模型 Fable 5 辅助挖掘错误(主要分 impossible、false negative、false positive 三类),再人工逐一确认,过滤掉未达证据门槛的候选错误。

代表性错误包括:CS 类题目要求对 8 个样本的序列做"4 点 DFT"(被判定 impossible)。结论是:模型在 HLE 上剩余的部分差距可能反映的是测试本身的问题,而非模型能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →