Epoch 报告 30/66 任务有评分缺陷,但基准并非"已损坏"
DimitrisPapail · x · 2026-09-19
Epoch 对 Terminal-Bench 4.0 的审查发现 66 个任务中 30 个存在评分缺陷(可被利用的 grader、答案泄漏、正确解被拒等),引发"TB 4.0 已损坏"的解读争议。
@DimitrisPapail 认为 Epoch 虽未明说 broken,但呈现方式容易让人误解为"不可信"。@ajratner 补充关键事实:这些问题正是 terminal-bench 团队自己以 PR 形式标记的(Epoch 由此发现),且实证确认仅影响不到 3% 的榜单 rollout,远在报告的置信区间内。
各方共识:grader 可被利用确实需要修复,但"30/66 任务有缺陷"不等于"45% 结果错误"——可利用性不等于实际被利用频率。团队正在推进开源基准持续改进的模式,这是一个持续演进的基准而非失效的基准。
所属事件:Terminal Bench 4.0 被审计发现大量缺陷,各方激辩影响程度(3 条相关)→
「研究」频道最新
- 经济学家用 AI 语音面试投稿人,亲测通过自己的论文 — soumitrashukla9 · 2026-09-19
- 双系统 RL 智能体在魔兽争霸 3 环境中完胜电脑,即将开源 — generativist · 2026-09-19
- 脑信号成功解码想象旋律:靠相对音高重建心中歌曲轮廓 — DrKavner · 2026-09-19
- AI 时代的学术圈正在分化为守门人、AI 信徒与策展人三大部落 — ipeirotis · 2026-09-19
- 用完整磁流体力学方程模拟木星磁层 — burny_tech · 2026-09-19
- 四个大模型家族跑出数学前 500 开放难题榜,Navier-Stokes 新结果仅涉受迫情形 — zero0_one1 · 2026-09-19