Epoch AI 推出 Benchmark Reviews:审计 15 个基准,9 个被判定有缺陷

Jsevillamol · x · 2026-09-18

研究机构 Epoch AI 启动 Benchmark Reviews 计划,系统性审计 AI 基准测试。首批覆盖 15 个基准:4 个通过验证(Verified),9 个被判定存在缺陷(Flawed),2 个因信息不足暂无法评审。

发起人 Alex Barry 表示,深耕 AI 基准的人会随时间形成「哪些基准值得关注」的判断,希望把这个隐性经验做成可公开获取的资源,同时推动整体基准质量提升。对关注模型评测可信度的人是重要参考。

所属事件:Epoch AI 审计 15 个 AI 基准,9 个被判定存在缺陷(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →