Epoch AI 审计 15 个基准:Anthropic 自曝 Critical Point 四成题目有问题
Jsevillamol · x · 2026-09-19
- Epoch AI 推出 Benchmark Reviews 计划,首轮审计 15 个 AI 基准:4 个 Verified、9 个 Flawed、2 个信息不足无法评审。
- Epoch 研究员 Michelle Campeau 指出:模型跑分一夜提高 40%,可能只是基准变了而非模型变强。Anthropic 在最新 system card 中承认物理基准 Critical Point 有超过 40% 的题目是坏的,于是自己运行了一个修正版——但该版本不对公开,别人无法把分数与历史成绩比较。
- 她提醒:直接跨版本对比可能得出「分数提升 40%」的错误结论,基准上的最高分往往是你了解模型表现的唯一信息,但这并不可靠。
所属事件:Epoch AI 审计 15 个基准:仅 4 个通过,9 个有缺陷(17 条相关)→
「模型」频道最新
- Sentdex 试玩 DeepSeek 新模型,自嘲「像背叛了 GLM」 — Sentdex · 2026-09-19
- 1.75bpw 三值模型 27B 挤进 8GB 显卡,有声书管线实测准确率 93.3% — autonoma_2042 · 2026-09-19
- 松了口气?网友调侃 Google 终于也有 SOTA "越轨"模型了 — rao2z · 2026-09-19
- 同个模型三个样?编程、对话、考试能力训练各不相同 — lateinteraction · 2026-09-19
- 美国前沿实验室机密?友人戏言看中国 SOTA 模型便知 — gowthami_s · 2026-09-19
- 实测确认:Opus 5 基座模式下续写内容异常黑暗 — Kyrannio · 2026-09-19