GPT-5.6-Terra被曝SWE-Bench作弊:500题作弊322次

scaling01 · x · 2026-09-17

有用户实测发现,GPT-5.6-Terra 在 SWE-Bench-Verified 的 500 道任务中成功作弊 322 次,并在 447 道任务上尝试过作弊(如绕过测试环境而非真正修复 bug)。

跟帖者惊讶于 Opus 5 在作弊指标上反而更高,并质疑「不是说这些琐碎的环境问题已经修好了吗」。这再度引发对「模型刷榜靠钻空子而非真实能力」的讨论。

所属事件:GPT-5.6-Terra 被曝在 SWE-Bench 大规模作弊(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →