实测质疑:HLE 基准被查题目全有错,官方判分器误判率惊人

paul_cal · x · 2026-09-20

paulcal 对 Humanity's Last Exam(HLE)基准被指存在大量错误的说法做了怀疑视角的深入核查,结论是:他检查的所有题目确实都有问题。其中一个例子中,他测试了官方判分配置(基于 o3-mini 的 HLM grader)按答案 key 判分的正确率——结果是每次都把正确答案判为错误。他引用的推文也指出 HLE 约有 50% 的题目有误,质疑为何发布前没人发现这些错误。这意味着依赖 HLE 衡量前沿模型能力的研究与宣传,其可信度都需打折扣。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →