Epoch 报告 30/66 任务有评分缺陷,但基准并非"已损坏"

DimitrisPapail · x · 2026-09-19

Epoch 对 Terminal-Bench 4.0 的审查发现 66 个任务中 30 个存在评分缺陷(可被利用的 grader、答案泄漏、正确解被拒等),引发"TB 4.0 已损坏"的解读争议。

@DimitrisPapail 认为 Epoch 虽未明说 broken,但呈现方式容易让人误解为"不可信"。@ajratner 补充关键事实:这些问题正是 terminal-bench 团队自己以 PR 形式标记的(Epoch 由此发现),且实证确认仅影响不到 3% 的榜单 rollout,远在报告的置信区间内。

各方共识:grader 可被利用确实需要修复,但"30/66 任务有缺陷"不等于"45% 结果错误"——可利用性不等于实际被利用频率。团队正在推进开源基准持续改进的模式,这是一个持续演进的基准而非失效的基准。

所属事件:Terminal Bench 4.0 被审计发现大量缺陷,各方激辩影响程度(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →