Epoch AI 推出 Benchmark Reviews:审计 15 个基准,9 个被判定有缺陷
Jsevillamol · x · 2026-09-18
研究机构 Epoch AI 启动 Benchmark Reviews 计划,系统性审计 AI 基准测试。首批覆盖 15 个基准:4 个通过验证(Verified),9 个被判定存在缺陷(Flawed),2 个因信息不足暂无法评审。
发起人 Alex Barry 表示,深耕 AI 基准的人会随时间形成「哪些基准值得关注」的判断,希望把这个隐性经验做成可公开获取的资源,同时推动整体基准质量提升。对关注模型评测可信度的人是重要参考。
所属事件:Epoch AI 审计 15 个 AI 基准,9 个被判定存在缺陷(4 条相关)→
「模型」频道最新
- 开发者曝 Codex 安全加固后改单条消息实例,破坏 agent 记忆连续性 — RileyRalmuto · 2026-09-18
- Anthropic 隐形模型遭质疑:据称 A-1 任务硬编码路由至 Opus 5 — teortaxesTex · 2026-09-18
- GPT-6 Astra 两天通关 Factorio 太空时代 — ResultBackground2450 · 2026-09-18
- 自称 ChatGPT 联合发明者推出新模型 Jev:号称快 20-200 倍、便宜 40-400 倍 — multiply_matrix · 2026-09-18
- Jev 团队放话:按现价可持续供应,「智能价格地板即将崩塌」 — charles_irl · 2026-09-18
- 曝 GPT-6 Astra 登顶 FrontierSWE,600MB 音频压缩至 20KB — soumitrashukla9 · 2026-09-18