Epoch 审计 15 个主流 AI 基准:4 个合格、9 个有缺陷
iamrobotbear · x · 2026-09-18
- Epoch AI 推出新项目 Benchmark Reviews,对 AI 基准测试进行系统性审计,首批覆盖 15 个基准:4 个 Verified(通过审计)、9 个 Flawed(存在缺陷)、2 个信息不足无法评审。
- Ethan Mollick 转发评论称这揭示了当前基准测试现状之糟——许多我们熟悉和喜爱的基准其实很不可靠。
- 该项目为社区提供了对常用 benchmark 质量的独立核查参考。
所属事件:Epoch AI 启动基准审计:15 个评测仅 4 个获 Verified(8 条相关)→
「模型」频道最新
- DeepSeek 加强内容审核,黄文写作将被限制 — teortaxesTex · 2026-09-18
- 传闻 Grok 4.7 即将发布 — kimmonismus · 2026-09-18
- GitLab 托管 Kimi K3、GLM 5.3 等开源模型:同等额度调用数提升 4 倍 — RealGeneKim · 2026-09-18
- 用户 10 小时重度 Codex 后周额度竟原地不动:用量恒在 6% — ___Patrice___ · 2026-09-18
- ChatGPT 联合发明人推出 Jev:宣称比 LLM 快 20-200 倍、便宜 40-400 倍 — GabGarrett · 2026-09-18
- 跑遍 10 个服务数小时仍花不掉 1 美元:Jev 定价引发热议 — multiply_matrix · 2026-09-18