Epoch AI 启动基准审计:15 个基准 9 个被判「有缺陷」引反弹

DimitrisPapail · x · 2026-09-19

Epoch AI 推出 Benchmark Reviews 审计计划,首批审查 15 个 AI 基准:4 个 Verified、9 个 Flawed、2 个信息不足。其评价 Terminal Bench 4.0 中 45.5% 的任务经审查存在缺陷,被指「Flawed/Broken」后引发争议。Berkeley 教授 Alex Dimakis 反驳:TB4 是大型社区工程,所提 bug 多为 GitHub 上已公开、社区正在修复的问题;实际任务缺陷仅影响排行榜不到 3% 的 rollout,把有 open issue 的开源基准称为 broken 不公平,审计更有价值的做法应是发现未知问题。

所属事件:Epoch AI 首批审计 15 个基准:9 个存在缺陷(15 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →