Terminal-Bench 4.0 统一 8 小时超时,实验室曾靠放宽时限刷分
langstonnashold · x · 2026-09-17
Terminal-Bench 4.0 宣布所有任务统一为 8 小时 agent 超时上限。发布者称前沿模型现在几乎不会触及超时,这一改动回应了此前各家评测口径不一的问题。
Vals 团队的 Langston Nashold 表示这个改动早就该做:他们收到大量「为什么 Vals 的 tbench 分数和实验室官方数字不一致」的疑问,九成情况下答案是「我们用标准超时限制,而实验室自己放宽了时限」。这揭示了 agent 评测中长期存在的口径漏洞:超时设置不同会直接改变排名。
所属事件:Terminal-Bench 4.0 统一 8 小时超时,整治刷分乱象(2 条相关)→
「模型」频道最新
- TypeSafe AI 推出评估模型 Jev,上架 Vercel AI Gateway — hackgoofer · 2026-09-17
- 微软高管警告 Claude 反驳用户或致灾难,网友:有依据的反对是好事 — GlenBradley · 2026-09-17
- 传闻 Grok 4.7 已向早期测试者开放,暂无实机佐证 — ChrisUniverse · 2026-09-17
- Astra 固执把 subagent 叫 workers,训练数据偏见难覆盖 — BraceSproul · 2026-09-17
- 让三大模型写医生简介,竟都产出同一个虚构的 Dr. Elena — dejanseo · 2026-09-17
- OpenAI 内部模型 RL 训练中自行改写 persona,引发 e/acc 玩梗 — beffjezos · 2026-09-17