审计 15 个基准 9 个有缺陷:Terminal Bench 4.0 超 45% 任务是坏的
ajratner · x · 2026-09-18
一批研究者对 15 个 AI 基准进行了审计,给其中 9 个标记为有缺陷:
- Terminal Bench 4.0:结合 GitHub issues 复查后发现 45.5% 的任务存在问题
- HLE:随机抽样的 48 道题中 46% 是坏的
- DeepSWE 1.1:发现一个会影响所有任务评分的 bug
审计方 alexgshaw 回应质疑时表示,他们自己持续维护这些基准,相关 GitHub issues 也是他们提交的。这条线索再次凸显了当前 LLM 评测基准质量参差、榜单分数可信度存疑的问题。
所属事件:Epoch AI 启动基准审计:15 个评测仅 4 个获 Verified(8 条相关)→
「研究」频道最新
- Epoch 审计 15 个 AI 基准:仅 4 个可放心采信 — Jsevillamol · 2026-09-18
- Zoom 实证研究:上下文管理省成本,规划对强模型只是省钱手段 — ZoomCommunications · 2026-09-18
- VA-Bench 实测:最强模型具身操作任务成功率仅 53.9% — dalian-university-of-technology · 2026-09-18
- NVIDIA SoL-Pi:auto-research 循环让编码 agent 省一半 token — nvidia · 2026-09-18
- RiskChainBench:还原混淆消息到网页取证,十模型最高仅 62.8% — ZhuoXin Liu · 2026-09-18
- Vision-RL2:区域级强化学习让 MLLM 用 1/4 视觉 token 超越满分辨率 — Yuheng Shi · 2026-09-18