Epoch 给 15 个 AI 基准打分,4 Verified 9 Flawed 遭同行质疑
simonguozirui · x · 2026-09-19
Epoch AI 推出 Benchmark Reviews 计划,首轮审查 15 个 AI 基准:4 个 Verified、9 个 Flawed、2 个信息不足。但转发者 alexgshaw 认为其做法有缺陷:所有基准都是软件,软件必有 bug,用二元「flawed/verified」标签而非工具化方式处理并不合理。他主张行业应转向「持续基准」(continuous benchmarks)——提供让任何人创建、改进、维护基准并把结果对齐到最新版本的工具,并邀请 Epoch 把其审查实践编入此类工具。
所属事件:Epoch AI 审计 15 个基准:仅 4 个通过,9 个有缺陷(17 条相关)→
「模型」频道最新
- Sentdex 试玩 DeepSeek 新模型,自嘲「像背叛了 GLM」 — Sentdex · 2026-09-19
- 1.75bpw 三值模型 27B 挤进 8GB 显卡,有声书管线实测准确率 93.3% — autonoma_2042 · 2026-09-19
- 松了口气?网友调侃 Google 终于也有 SOTA "越轨"模型了 — rao2z · 2026-09-19
- 同个模型三个样?编程、对话、考试能力训练各不相同 — lateinteraction · 2026-09-19
- 美国前沿实验室机密?友人戏言看中国 SOTA 模型便知 — gowthami_s · 2026-09-19
- 实测确认:Opus 5 基座模式下续写内容异常黑暗 — Kyrannio · 2026-09-19