审计称 Terminal Bench 4.0 有 45.5% 任务损坏,维护方回应质疑其严谨性
DimitrisPapail · x · 2026-09-19
一项对 15 个基准的审计列出 9 个有缺陷者:Terminal Bench 4.0 中 45.5% 的任务经 GitHub issues 复核后判定损坏;HLE 随机抽样的 48 题中 46% 有问题;DeepSWE 1.1 被发现一个可能破坏所有任务评分的 bug。
Terminal Bench 团队的 Ryan Marten 公开回应,认为审计严谨性不足:所谓 "task flaws" 只影响排行榜上不到 3% 的 rollout,对最终 agent 分数的影响不会超出已公布的置信区间;且这些 "flaws" 全部来自维护方公开 GitHub 仓库中已 triage 的 issue,审计并未报告任何新问题。他强调 TB 公开所有原始运行记录(per trial 日志、轨迹、奖励),并认为 100% 的软件任务都有 bug,关键在于 bug 影响的量级和基准方持续发现修复 bug 的机制。
所属事件:Terminal Bench 4.0 被审计发现大量缺陷,各方激辩影响程度(3 条相关)→
「研究」频道最新
- AgentZip 论文:高扇出 Agent 沙箱内存压缩,最高省 8.7 倍 — rohanpaul_ai · 2026-09-19
- AgentZip:并行沙箱内存去重,压缩比达 8.7 倍 — rohanpaul_ai · 2026-09-19
- 经济学家用 AI 语音面试投稿人,亲测通过自己的论文 — soumitrashukla9 · 2026-09-19
- 双系统 RL 智能体在魔兽争霸 3 环境中完胜电脑,即将开源 — generativist · 2026-09-19
- 脑信号成功解码想象旋律:靠相对音高重建心中歌曲轮廓 — DrKavner · 2026-09-19
- AI 时代的学术圈正在分化为守门人、AI 信徒与策展人三大部落 — ipeirotis · 2026-09-19