Epoch AI 审查「人类最后的考试」:抽检 46% 题目存在实质性错误
charles_irl · x · 2026-09-19
Epoch AI 对知名基准 Humanity's Last Exam 的审查结论是 Flawed(有缺陷)。
- 审查方法:从 8 个学科(生物/医学、化学、计算机、工程、人文社科、数学、物理、其他)各抽 6 题,共 48 题,先用 Fable 5 辅助找错,再人工逐条核实,只保留达证据门槛的错误。
- 结果:48 题中 22 题(46%)存在会改变正确率判断的实质性错误。
- 错误分三类:12 题「按原文不可能答对」(缺少必要前提、前提自相矛盾、存在多种合理解释、要求对主观问题给出客观答案);10 题良构题可能产生假阴性,其中 5 题还可能产生假阳性。
- 典型案例:计算机/AI 类一题要求做「4 点 DFT」离散傅里叶变换,但序列有 8 个样本。
- 该基准由 Center for AI Safety、Scale AI 及独立贡献者通过公众征集编制;本次审查针对原版,不涉及 HLE-Rolling 或 HLE-Verified。
所属事件:Epoch AI 审计 15 个基准:仅 4 个通过,9 个有缺陷(17 条相关)→
「模型」频道最新
- 神秘模型 Jev 发布:宣称快 200 倍便宜 400 倍,网友实测叫好 — multiply_matrix · 2026-09-19
- GLM/DeepSeek/Qwen 开源小模型横评:质量看 GLM,速度选 Qwen — HankYeomans · 2026-09-19
- Ternary Bonsai 2 27B 压到 7GB 单文件,8GB 显存可跑 — cephaloform · 2026-09-19
- 研究者反驳Jev定位:语言本质是System 2,拿它做System 1说不通 — emax · 2026-09-19
- 闭源模型怎么被蒸馏?Reddit 热议 Anthropic 指控背后的技术机制 — LaughLegit7275 · 2026-09-19
- OpenAI 员工回应语音语言争议:英文音色也适用于多语言 — juberti · 2026-09-19