Epoch AI 首批基准审计:15 个基准 4 个 Verified 9 个 Flawed,PostTrainBench 过审
maksym_andr · x · 2026-09-18
Epoch AI 启动 Benchmark Reviews 计划,对 AI 基准做独立审计,首批覆盖 15 个基准:4 个 Verified、9 个 Flawed、2 个信息不足以评审。PostTrainBench v1.1 获「Verified」认定,团队同步发布逐条回应:
- 针对「过拟合单一评测」的批评:这正是设计意图——每个 agent 只有一张 H100、十小时预算做后训练,预算内教通用可迁移技能不现实,问题是能否在目标基准上提升模型
- 针对「评分均值与方差问题」:团队人工核验被判污染的运行,确认裁判模型校准无误
- 承认部分批评成立,即将发布 v1.2 修复主要问题及自查发现的新问题
所属事件:Epoch AI 审计 15 个基准:仅 4 个通过,9 个有缺陷(17 条相关)→
「模型」频道最新
- Sentdex 试玩 DeepSeek 新模型,自嘲「像背叛了 GLM」 — Sentdex · 2026-09-19
- 1.75bpw 三值模型 27B 挤进 8GB 显卡,有声书管线实测准确率 93.3% — autonoma_2042 · 2026-09-19
- 松了口气?网友调侃 Google 终于也有 SOTA "越轨"模型了 — rao2z · 2026-09-19
- 同个模型三个样?编程、对话、考试能力训练各不相同 — lateinteraction · 2026-09-19
- 美国前沿实验室机密?友人戏言看中国 SOTA 模型便知 — gowthami_s · 2026-09-19
- 实测确认:Opus 5 基座模式下续写内容异常黑暗 — Kyrannio · 2026-09-19