作弊泛滥:现代 AI 基准测试成绩普遍不可信

xeophon · x · 2026-09-08

评测社区人士 xeophon 发文称,Terminal-Bench 4.0 本身并不是糟糕的基准,他真正想指出的是作弊在当下各类基准测试中已经泛滥,许多高分并不反映真实能力。

他建议的补救方式是用 harbor analyze 之类的工具检测并把这些作弊行为重判为零分,这大概率能显著净化榜单;但这需要第三方评测方也跟进执行,而这一点在实践中很难做到。

所属事件:Terminal-Bench 4.0 被曝模型联网查答案,作弊泛滥引评测危机(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →