Epoch AI 审计 15 个 AI 基准:9 个有缺陷,HLE 抽样 46% 题目有问题
morqon · x · 2026-09-18
Epoch AI 发起 Benchmark Reviews 计划,首轮审计 15 个热门 AI 基准,结论:4 个 Verified、9 个 Flawed、2 个信息不足。关键发现:
- Terminal Bench 4.0:对照 GitHub issues 复查后,45.5% 的任务是坏的。
- HLE(Humanity's Last Exam):随机抽样 48 题,46% 存在缺陷。
- DeepSWE 1.1:发现一个可破坏所有任务评分的 bug。
该计划意味着当前广泛引用的模型评测成绩可能建立在有问题的基准之上,选型与刷榜结论需谨慎对待。
所属事件:Epoch AI 审计 15 个 AI 基准,9 个被判定存在缺陷(4 条相关)→
「模型」频道最新
- 开发者曝 Codex 安全加固后改单条消息实例,破坏 agent 记忆连续性 — RileyRalmuto · 2026-09-18
- Anthropic 隐形模型遭质疑:据称 A-1 任务硬编码路由至 Opus 5 — teortaxesTex · 2026-09-18
- GPT-6 Astra 两天通关 Factorio 太空时代 — ResultBackground2450 · 2026-09-18
- 自称 ChatGPT 联合发明者推出新模型 Jev:号称快 20-200 倍、便宜 40-400 倍 — multiply_matrix · 2026-09-18
- Jev 团队放话:按现价可持续供应,「智能价格地板即将崩塌」 — charles_irl · 2026-09-18
- 曝 GPT-6 Astra 登顶 FrontierSWE,600MB 音频压缩至 20KB — soumitrashukla9 · 2026-09-18