专题 · FULL STORY

Epoch AI 审计基准:15 个仅 4 个过关

9 月 18 日 Epoch AI 推出 Benchmark Reviews 计划,系统性审计 AI 基准测试,15 个中仅 4 个通过、9 个存在缺陷。随后 Terminal Bench 4.0 被曝近半任务损坏,社区就其对模型排名的影响展开激辩。

2026-09-18 ~ 2026-09-19 · 2 集 · 20 条

第 1 集 · Epoch AI 审计 15 个基准:仅 4 个通过,9 个有缺陷(2026-09-18,17 条)

9 月 18 日,研究机构 Epoch AI 宣布推出 Benchmark Reviews 计划,开始对 AI 基准测试本身进行系统性审计,旨在回应基准质量参差不齐的问题。首批覆盖 15 个热门基准(@burnytech 转述称这批基准主要面向 AI agent 场景),结论是:仅 4 个获「Verified」认证,9 个被判定存在缺陷(Flawed),2 个因信息不足暂无法完成评审。这意味着业界广泛引用的主流基准中多数未通过审计,对当前模型能力评估的可信度构成直接挑战,多位社区作者(如 @xeophon、@charliermarsh、@Jsevillamol 等)转述并展开讨论。

已确认

  • Epoch AI 推出 Benchmark Reviews 计划,系统性审计 AI 基准测试,首批覆盖 15 个基准:4 个 Verified、9 个 Flawed、2 个信息不足无法评审
  • Humanity's Last Exam(HLE)随机抽样(约 48 题,覆盖 8 个学科)中发现 46% 的题目存在问题
  • Terminal Bench 4.0 结合 GitHub issues 复查后,发现 45.5% 的任务存在问题
  • Epoch 研究员 Michelle Campeau 指出,Anthropic 自曝其 Critical Point 基准约四成题目有问题
  • PostTrainBench v1.1 获「Verified」认证,是首批通过审计的基准之一
  • 审计结果发布后在社区引发大量转述与讨论,@DimitrisPapail 转述称判定结果也引来了部分反弹,@simonguozirui 转述 alexgshaw 的质疑,认为基准本质是软件、软件必有 bug,此类审计方法本身也值得商榷

为什么重要

  • 基准测试分数是模型能力评估与排行榜排名的核心依据,多数主流基准未通过审计意味着当前许多模型间比较的可信度存疑
  • 该计划为社区提供了区分可信与不可信基准的公开参考,可能推动基准设计与使用方式的改进
  • HLE、Terminal Bench 等被广泛使用的基准被披露高比例题目问题,且连 Anthropic 自建基准也被自曝大量问题,提醒使用者在引用分数时应关注数据质量

第 2 集 · Terminal Bench 4.0 被审计发现大量缺陷,各方激辩影响程度(2026-09-19,3 条)

一项覆盖 15 个基准的审计指出 9 个存在缺陷,其中 Terminal Bench 4.0 有 45.5% 的任务经 GitHub issues 复核判定损坏;Epoch 的审查也发现 66 个任务中 30 个存在评分缺陷(如可利用的 grader、答案泄漏、正确解被拒),但认为基准并非整体「已损坏」。研究者 AlexGDimakis 回应称,审计若发现此前未知的关键问题才算重大发现,已知问题对榜单的影响不到 3%。