审计 15 个基准 9 个有缺陷:Terminal Bench 4.0 超 45% 任务是坏的

ajratner · x · 2026-09-18

一批研究者对 15 个 AI 基准进行了审计,给其中 9 个标记为有缺陷:

审计方 alexgshaw 回应质疑时表示,他们自己持续维护这些基准,相关 GitHub issues 也是他们提交的。这条线索再次凸显了当前 LLM 评测基准质量参差、榜单分数可信度存疑的问题。

所属事件:Epoch AI 启动基准审计:15 个评测仅 4 个获 Verified(8 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →