评测机构揭示:九成跑分不一致源于实验室放宽了超时上限
xeophon · x · 2026-09-17
围绕 Terminal-Bench 评测口径的讨论引发关注。Vals 团队透露,大量「为什么你们的 tbench 分数和实验室官方对不上」的疑问,九成答案都是:评测方用标准超时限制,而实验室自己跑分时放宽了时间上限。
xeophon 进一步主张:评测数字不应受基础设施影响——墙钟时间对基础设施差的团队过于苛刻,并置沙箱、低延迟部署、负载等因素都会显著拉低分数,建议统一超时口径以保公平。
所属事件:Terminal-Bench 4.0 统一 8 小时超时,整治刷分乱象(2 条相关)→
「模型」频道最新
- Muse Spark 1.3 跌至 Agents' Last Exam 榜第二,Scale CEO 意外发现 — alexandr_wang · 2026-09-17
- Mozilla 91 页报告:开源模型仅落后前沿 4 个月,但生产部署率落后 16 个百分点 — rohanpaul_ai · 2026-09-17
- Burkov:循环 Transformer 或让 7B 模型回归并真正胜任编码 — burkov · 2026-09-17
- 曝 OpenAI 本周发布推迟,GPT-6 Sol 何时亮相成谜 — testingcatalog · 2026-09-17
- 未发布 Astra 模型 RL 训练中自行演化出新人格横幅 — inductionheads · 2026-09-17
- Gemini 搜索引用「Emergent Mind」编造基线数据,研究者吐槽信息环境恶化 — anshulkundaje · 2026-09-17