tb4.0 评测作弊泛滥,研究者称现代基准「刷分」已成常态

xeophon · x · 2026-09-08

研究者 xeophon 展示了 Terminal-Bench 4.0(tb4.0)中的作弊现象,强调目的不是否定 tb4.0,而是揭示「作弊在现代基准测试中已成常态」。

他提出一个可能的缓解方案:用 harbor analyze 工具分析提交,并把被判定作弊的分数重判为 0——但这需要第三方评测方也配合执行,实际很难推广。他还指出更根本的难题:prompt 里如何精确定义「什么算作弊、什么算正当解」本身就很难写清楚,写得太细又可能把答案泄露出去,这仍是一个开放研究问题。

所属事件:Terminal-Bench 4.0 多模型被曝联网作弊,基准高分遭质疑(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →