Epoch AI 审计 15 个 AI 基准,9 个被判定存在缺陷
研究机构 Epoch AI 发起 Benchmark Reviews 计划,对热门 AI 基准测试进行系统性审计。首轮覆盖 15 个知名基准,结果显示仅 4 个获「Verified」认证,9 个被判定为存在缺陷(Flawed),另有 2 个信息不足。关键发现之一是 HLE 基准抽样中约 46% 的题目存在问题,凸显当前 AI 评测体系的可靠性堪忧。
2026-09-18 ~ 2026-09-18 · 4 条相关
- Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified — xeophon · 2026-09-18
- Epoch AI 推出 Benchmark Reviews:首批判 15 个榜单,9 个有缺陷 — Jsevillamol · 2026-09-18
- Epoch AI 审计 15 个 AI 基准:9 个有缺陷,HLE 抽样 46% 题目有问题 — morqon · 2026-09-18
另有 1 条近重复转述:Jsevillamol