评测机构揭示:九成跑分不一致源于实验室放宽了超时上限

xeophon · x · 2026-09-17

围绕 Terminal-Bench 评测口径的讨论引发关注。Vals 团队透露,大量「为什么你们的 tbench 分数和实验室官方对不上」的疑问,九成答案都是:评测方用标准超时限制,而实验室自己跑分时放宽了时间上限。

xeophon 进一步主张:评测数字不应受基础设施影响——墙钟时间对基础设施差的团队过于苛刻,并置沙箱、低延迟部署、负载等因素都会显著拉低分数,建议统一超时口径以保公平。

所属事件:Terminal-Bench 4.0 统一 8 小时超时,整治刷分乱象(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →