实测质疑:HLE 基准被查题目全有错,官方判分器误判率惊人
paul_cal · x · 2026-09-20
paulcal 对 Humanity's Last Exam(HLE)基准被指存在大量错误的说法做了怀疑视角的深入核查,结论是:他检查的所有题目确实都有问题。其中一个例子中,他测试了官方判分配置(基于 o3-mini 的 HLM grader)按答案 key 判分的正确率——结果是每次都把正确答案判为错误。他引用的推文也指出 HLE 约有 50% 的题目有误,质疑为何发布前没人发现这些错误。这意味着依赖 HLE 衡量前沿模型能力的研究与宣传,其可信度都需打折扣。
「模型」频道最新
- Jev等System One模型做agent底座的三个看点 — omarsar0 · 2026-09-20
- 评测者称纯代码启发式策略可在 Craftax 上胜过大模型 — JoshPurtell · 2026-09-20
- OpenAI Codex 全员重置已生效,官方预告周二有大发布 — kimmonismus · 2026-09-20
- Jev 做 PR 审查比 GPT-5.6 Luna 快 1.93 倍,单次仅 $0.0014 — aniketmaurya · 2026-09-20
- 果蝇连接组国际象棋模型击败 Jev,Labonne 再战一个 — maximelabonne · 2026-09-20
- Bonsai 2 27B 安全护栏砍掉近 20 分,SWE-bench 与 Terminal-bench 成绩大缩水 — julianharris · 2026-09-20