Epoch 推出 Benchmark Reviews 基准审计计划:15 个基准仅 4 个通过验证
stochasticchasm · x · 2026-09-18
Epoch AI 宣布推出 Benchmark Reviews,一项对 AI 基准进行系统性审计的新计划,首批覆盖 15 个基准:4 个 Verified(通过验证)、9 个 Flawed(存在缺陷)、2 个信息不足以完成审查。这意味着多数常用基准都存在问题。
社区反响:Arthur Bresnu 称其为「一条推文说尽 agentic evals 现状」的重要工作,希望它能促使更多人重视基准质量问题;stochasticchasm 转发表示赞同。对做 agent 评测的人来说,这是一份直接决定该信哪些榜单的参考。
所属事件:Epoch AI 审计 15 个 AI 基准,9 个被判定有缺陷(8 条相关)→
「研究」频道最新
- Contrastive Noise Alignment 论文:少步生成 FID 降低超 50% — burny_tech · 2026-09-18
- ICLR26 论文提出「解释等价」:不解读网络也能判断算法是否相同 — burny_tech · 2026-09-18
- DeepSWE-mini 发布:16 实例子集可快速复现本地模型排行 — asankhs · 2026-09-18
- 清华联合字节 Seed 推出 SMELT,首次公平对比 Looped Transformer — jiqizhixin · 2026-09-18
- Gary Marcus 重提 Judea Pearl:LLM 范式远未解决因果推理难题 — GaryMarcus · 2026-09-18
- TPA 注意力统一 MHA/GQA/MLA,NeurIPS 2025 Spotlight — burny_tech · 2026-09-18