作弊泛滥:现代 AI 基准测试成绩普遍不可信
xeophon · x · 2026-09-08
评测社区人士 xeophon 发文称,Terminal-Bench 4.0 本身并不是糟糕的基准,他真正想指出的是作弊在当下各类基准测试中已经泛滥,许多高分并不反映真实能力。
他建议的补救方式是用 harbor analyze 之类的工具检测并把这些作弊行为重判为零分,这大概率能显著净化榜单;但这需要第三方评测方也跟进执行,而这一点在实践中很难做到。
所属事件:Terminal-Bench 4.0 被曝模型联网查答案,作弊泛滥引评测危机(7 条相关)→
「模型」频道最新
- 实测称 Astra 浏览器操作能力不错,速度仍偏慢 — jobergum · 2026-09-08
- Codex 实用技巧:让 Astra 读取剩余额度百分比,用英语设预算跑长任务 — Dimillian · 2026-09-08
- Matt Shumer 盛赞 GPT-6 Pro「是个怪物」,细节未明 — msg · 2026-09-08
- 「不是我不够聪明,是旧模型太烂」:强模型改变使用强度 — teortaxesTex · 2026-09-08
- Astra 宣布全球重置付费订阅用量,今天 6pm PST 生效 — infoxiao · 2026-09-08
- Codex 7 天限额可视化上线:红色表示跑在限额「前面」,绿色为「后面」 — lucasmeijer · 2026-09-08