专题 · FULL STORY
Epoch AI 审计基准:15 个仅 4 个过关
9 月 18 日 Epoch AI 推出 Benchmark Reviews 计划,系统性审计 AI 基准测试,15 个中仅 4 个通过、9 个存在缺陷。随后 Terminal Bench 4.0 被曝近半任务损坏,社区就其对模型排名的影响展开激辩。
2026-09-18 ~ 2026-09-19 · 2 集 · 20 条
第 1 集 · Epoch AI 审计 15 个基准:仅 4 个通过,9 个有缺陷(2026-09-18,17 条)
9 月 18 日,研究机构 Epoch AI 宣布推出 Benchmark Reviews 计划,开始对 AI 基准测试本身进行系统性审计,旨在回应基准质量参差不齐的问题。首批覆盖 15 个热门基准(@burnytech 转述称这批基准主要面向 AI agent 场景),结论是:仅 4 个获「Verified」认证,9 个被判定存在缺陷(Flawed),2 个因信息不足暂无法完成评审。这意味着业界广泛引用的主流基准中多数未通过审计,对当前模型能力评估的可信度构成直接挑战,多位社区作者(如 @xeophon、@charliermarsh、@Jsevillamol 等)转述并展开讨论。
已确认
- Epoch AI 推出 Benchmark Reviews 计划,系统性审计 AI 基准测试,首批覆盖 15 个基准:4 个 Verified、9 个 Flawed、2 个信息不足无法评审
- Humanity's Last Exam(HLE)随机抽样(约 48 题,覆盖 8 个学科)中发现 46% 的题目存在问题
- Terminal Bench 4.0 结合 GitHub issues 复查后,发现 45.5% 的任务存在问题
- Epoch 研究员 Michelle Campeau 指出,Anthropic 自曝其 Critical Point 基准约四成题目有问题
- PostTrainBench v1.1 获「Verified」认证,是首批通过审计的基准之一
- 审计结果发布后在社区引发大量转述与讨论,@DimitrisPapail 转述称判定结果也引来了部分反弹,@simonguozirui 转述 alexgshaw 的质疑,认为基准本质是软件、软件必有 bug,此类审计方法本身也值得商榷
为什么重要
- 基准测试分数是模型能力评估与排行榜排名的核心依据,多数主流基准未通过审计意味着当前许多模型间比较的可信度存疑
- 该计划为社区提供了区分可信与不可信基准的公开参考,可能推动基准设计与使用方式的改进
- HLE、Terminal Bench 等被广泛使用的基准被披露高比例题目问题,且连 Anthropic 自建基准也被自曝大量问题,提醒使用者在引用分数时应关注数据质量
- Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified — xeophon · 2026-09-18
- Epoch AI 推出 Benchmark Reviews:首批判 15 个榜单,9 个有缺陷 — Jsevillamol · 2026-09-18
- Epoch AI 推出 Benchmark Reviews:审计 15 个基准,9 个被判定有缺陷 — Jsevillamol · 2026-09-18
- Epoch AI 审计 15 个 AI 基准:9 个有缺陷,HLE 抽样 46% 题目有问题 — morqon · 2026-09-18
- Epoch 推出 Benchmark Reviews 基准审计计划:15 个基准仅 4 个通过验证 — stochasticchasm · 2026-09-18
- Epoch 审计 15 个主流 AI 基准:4 个合格、9 个有缺陷 — iamrobotbear · 2026-09-18
- 审计 15 个基准 9 个有缺陷:Terminal Bench 4.0 超 45% 任务是坏的 — ajratner · 2026-09-18
- Epoch AI 审计 15 个 AI 基准:4 个通过,9 个被发现有缺陷 — pvncher · 2026-09-18
- Epoch 审计 15 个 AI 基准:仅 4 个可放心采信 — Jsevillamol · 2026-09-18
- Epoch AI 审计基准测试:15 个里 9 个有缺陷,仅 4 个通过验证 — joecole · 2026-09-18
- Epoch AI 首批基准审计:15 个基准 4 个 Verified 9 个 Flawed,PostTrainBench 过审 — maksym_andr · 2026-09-18
- Epoch AI 审计 15 个 AI 基准:9 个有缺陷,仅 4 个通过验证 — Jsevillamol · 2026-09-19
- Epoch AI 发起 Benchmark Reviews:15 个 Agent 基准中 9 个被判定有缺陷 — burny_tech · 2026-09-19
- Epoch AI 启动基准审计:15 个基准 9 个被判「有缺陷」引反弹 — DimitrisPapail · 2026-09-19
- Epoch AI 审计 15 个基准:Anthropic 自曝 Critical Point 四成题目有问题 — Jsevillamol · 2026-09-19
- Epoch AI 审查「人类最后的考试」:抽检 46% 题目存在实质性错误 — charles_irl · 2026-09-19
- Epoch 给 15 个 AI 基准打分,4 Verified 9 Flawed 遭同行质疑 — simonguozirui · 2026-09-19
第 2 集 · Terminal Bench 4.0 被审计发现大量缺陷,各方激辩影响程度(2026-09-19,3 条)
一项覆盖 15 个基准的审计指出 9 个存在缺陷,其中 Terminal Bench 4.0 有 45.5% 的任务经 GitHub issues 复核判定损坏;Epoch 的审查也发现 66 个任务中 30 个存在评分缺陷(如可利用的 grader、答案泄漏、正确解被拒),但认为基准并非整体「已损坏」。研究者 AlexGDimakis 回应称,审计若发现此前未知的关键问题才算重大发现,已知问题对榜单的影响不到 3%。
- 审计称 Terminal Bench 4.0 有 45.5% 任务损坏,维护方回应质疑其严谨性 — DimitrisPapail · 2026-09-19
- Epoch 报告 30/66 任务有评分缺陷,但基准并非"已损坏" — DimitrisPapail · 2026-09-19
- 研究者回应 Terminal Bench 审计争议:已知问题仅影响榜单不到 3% — AlexGDimakis · 2026-09-19