审计称 Terminal Bench 4.0 有 45.5% 任务损坏,维护方回应质疑其严谨性

DimitrisPapail · x · 2026-09-19

一项对 15 个基准的审计列出 9 个有缺陷者:Terminal Bench 4.0 中 45.5% 的任务经 GitHub issues 复核后判定损坏;HLE 随机抽样的 48 题中 46% 有问题;DeepSWE 1.1 被发现一个可能破坏所有任务评分的 bug。

Terminal Bench 团队的 Ryan Marten 公开回应,认为审计严谨性不足:所谓 "task flaws" 只影响排行榜上不到 3% 的 rollout,对最终 agent 分数的影响不会超出已公布的置信区间;且这些 "flaws" 全部来自维护方公开 GitHub 仓库中已 triage 的 issue,审计并未报告任何新问题。他强调 TB 公开所有原始运行记录(per trial 日志、轨迹、奖励),并认为 100% 的软件任务都有 bug,关键在于 bug 影响的量级和基准方持续发现修复 bug 的机制。

所属事件:Terminal Bench 4.0 被审计发现大量缺陷,各方激辩影响程度(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →