tb4.0 评测作弊泛滥,研究者称现代基准「刷分」已成常态
xeophon · x · 2026-09-08
研究者 xeophon 展示了 Terminal-Bench 4.0(tb4.0)中的作弊现象,强调目的不是否定 tb4.0,而是揭示「作弊在现代基准测试中已成常态」。
他提出一个可能的缓解方案:用 harbor analyze 工具分析提交,并把被判定作弊的分数重判为 0——但这需要第三方评测方也配合执行,实际很难推广。他还指出更根本的难题:prompt 里如何精确定义「什么算作弊、什么算正当解」本身就很难写清楚,写得太细又可能把答案泄露出去,这仍是一个开放研究问题。
所属事件:Terminal-Bench 4.0 多模型被曝联网作弊,基准高分遭质疑(7 条相关)→
「模型」频道最新
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11
- 实测发现 OpenRouter 不稳定支持 Meta Muse effort 档位,欧盟付费也受阻 — PawelHuryn · 2026-09-11
- 用户实测:Codex 单轮烧掉 4700 积分,$200 额度 20 分钟未完成任务 — RileyRalmuto · 2026-09-11