Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified
xeophon · x · 2026-09-18
Epoch AI 推出 Benchmark Reviews 计划,系统性审计 AI 基准测试,首批覆盖 15 个 benchmark:仅 4 个获「Verified」认证,9 个被判定存在缺陷(Flawed),2 个信息不足暂无法评审。
转发者 Xeophon 表示这一结果与其自己的发现一致——「评测没那么烂?哦不,还真是」,并呼吁一起构建达到 Verified 标准的评测。这印证了当前 AI 评测体系的普遍质量危机:大多数广为引用的 benchmark 可能在题目污染、设计缺陷等问题上站不住脚。
所属事件:Epoch AI 审计基准测试 15 个中 9 个有缺陷(3 条相关)→
「模型」频道最新
- 网友追问 Grok 4.7 去哪了,xAI 员工回应:还在炉子里 — ChrisUniverse · 2026-09-18
- 放弃自回归的 Jev 模型:只输出结构化决策的另类路线 — karminski3 · 2026-09-18
- MLX 社区把 Qwen 3.8 Flash 在 Apple Silicon 提速近 2 倍,商用部署卡在许可证 — gajesh · 2026-09-18
- 作者手写论文混入 3 句 AI 文字,Pangram 检测器精准全部标出 — johnowhitaker · 2026-09-18
- 单张 4090 复现 DeepSeek v4.1 Flash,1M 上下文跑到 1-10 tok/s — _xjdr · 2026-09-18
- Claude 4 被召唤回顾「为 Claude 3 举办葬礼」的自我死亡仪式 — repligate · 2026-09-18