Epoch AI 审计基准测试:15 个里 9 个有缺陷,仅 4 个通过验证
joecole · x · 2026-09-18
Epoch AI 推出 Benchmark Reviews 计划,对 AI 基准测试本身进行审计,首批覆盖 15 个基准:仅 4 个获「Verified」认证,9 个被判定存在缺陷,另有 2 个信息不足无法评审。这意味着行业大量依赖的评测基准本身质量堪忧,基准分数的可信度需重新审视。
所属事件:Epoch AI 审计 15 个基准:9 个有缺陷仅 4 个通过(10 条相关)→
「研究」频道最新
- 卡马克详解 RL 中 Q 值高估问题,借 Relative Value Learning 简化方案 — ID_AA_Carmack · 2026-09-18
- AI 预测公司 Mantic 击败锦标赛全部 676 名人类,融资 2500 万美元 — tshevl · 2026-09-18
- sokrypton 引 AF3 论文:仅增随机种子成绩即从 0.3 升至 0.6 — sokrypton · 2026-09-18
- XGEN 发布世界模拟原型:JING 交互模型 + DAO 共享世界引擎 — anthara_ai · 2026-09-18
- 定制长寿 LLM 与 17 个前沿模型比拼抗衰老生物学评估并占优 — EricTopol · 2026-09-18
- TLMR 主编:53% 投稿直接拒,采访 10 位作者 3 人答不出基础问题 — Dr_Atoosa · 2026-09-18