Terminal-Bench 4.0 统一 8 小时超时,实验室曾靠放宽时限刷分

langstonnashold · x · 2026-09-17

Terminal-Bench 4.0 宣布所有任务统一为 8 小时 agent 超时上限。发布者称前沿模型现在几乎不会触及超时,这一改动回应了此前各家评测口径不一的问题。

Vals 团队的 Langston Nashold 表示这个改动早就该做:他们收到大量「为什么 Vals 的 tbench 分数和实验室官方数字不一致」的疑问,九成情况下答案是「我们用标准超时限制,而实验室自己放宽了时限」。这揭示了 agent 评测中长期存在的口径漏洞:超时设置不同会直接改变排名。

所属事件:Terminal-Bench 4.0 统一 8 小时超时,整治刷分乱象(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →