Epoch AI 发起 Benchmark Reviews:15 个 Agent 基准中 9 个被判定有缺陷
burny_tech · x · 2026-09-19
- Epoch AI 推出 Benchmark Reviews,新计划系统性审计 AI 基准测试,首批覆盖 15 个 AI agent 基准。
- 初步结论:仅 4 个通过验证(Verified),9 个被判定存在缺陷(Flawed),2 个因信息不足无法评审。
- ddkang(往期工作)呼应:AI agent 基准「早就坏了」,其团队 2025 年 7 月曾发布建立严格 agent 基准最佳实践的工作,与本计划相互印证。
所属事件:Epoch AI 审计 15 个基准:仅 4 个通过,9 个有缺陷(17 条相关)→
「模型」频道最新
- Sentdex 试玩 DeepSeek 新模型,自嘲「像背叛了 GLM」 — Sentdex · 2026-09-19
- 1.75bpw 三值模型 27B 挤进 8GB 显卡,有声书管线实测准确率 93.3% — autonoma_2042 · 2026-09-19
- 松了口气?网友调侃 Google 终于也有 SOTA "越轨"模型了 — rao2z · 2026-09-19
- 同个模型三个样?编程、对话、考试能力训练各不相同 — lateinteraction · 2026-09-19
- 美国前沿实验室机密?友人戏言看中国 SOTA 模型便知 — gowthami_s · 2026-09-19
- 实测确认:Opus 5 基座模式下续写内容异常黑暗 — Kyrannio · 2026-09-19