Epoch AI 审计 15 个 AI 基准:9 个有缺陷,HLE 抽样 46% 题目有问题

morqon · x · 2026-09-18

Epoch AI 发起 Benchmark Reviews 计划,首轮审计 15 个热门 AI 基准,结论:4 个 Verified、9 个 Flawed、2 个信息不足。关键发现:

该计划意味着当前广泛引用的模型评测成绩可能建立在有问题的基准之上,选型与刷榜结论需谨慎对待。

所属事件:Epoch AI 审计 15 个 AI 基准,9 个被判定存在缺陷(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →