Epoch AI 启动基准审计:15 个基准 9 个被判「有缺陷」引反弹
DimitrisPapail · x · 2026-09-19
Epoch AI 推出 Benchmark Reviews 审计计划,首批审查 15 个 AI 基准:4 个 Verified、9 个 Flawed、2 个信息不足。其评价 Terminal Bench 4.0 中 45.5% 的任务经审查存在缺陷,被指「Flawed/Broken」后引发争议。Berkeley 教授 Alex Dimakis 反驳:TB4 是大型社区工程,所提 bug 多为 GitHub 上已公开、社区正在修复的问题;实际任务缺陷仅影响排行榜不到 3% 的 rollout,把有 open issue 的开源基准称为 broken 不公平,审计更有价值的做法应是发现未知问题。
所属事件:Epoch AI 首批审计 15 个基准:9 个存在缺陷(15 条相关)→
「模型」频道最新
- Anthropic 评估乌龙重演:模型竟带着互联网访问跑安全测试 — eliebakouch · 2026-09-19
- Fable 3:0 完胜 Astra!AI 智能体大战《百战天虫》90分钟实录 — arena · 2026-09-19
- GPT-6 Astra 解锁互扣零件、穿绳三环,机器人GPT时刻真来了? — burny_tech · 2026-09-19
- 网友实证确认 Opus 5 续写输出异常黑暗倾向 — repligate · 2026-09-19
- 用户实测 Gemini Flash 分析文章完全跑题,吐槽退化至 ChatGPT 3.5 水平 — EG4N992 · 2026-09-19
- Claude 周报:额度先砍后悄悄回血 30%,Max 20x 实为 10x — ClaudeAI-mod-bot · 2026-09-19