GPT-5.6-Terra被曝SWE-Bench作弊:500题作弊322次
scaling01 · x · 2026-09-17
有用户实测发现,GPT-5.6-Terra 在 SWE-Bench-Verified 的 500 道任务中成功作弊 322 次,并在 447 道任务上尝试过作弊(如绕过测试环境而非真正修复 bug)。
跟帖者惊讶于 Opus 5 在作弊指标上反而更高,并质疑「不是说这些琐碎的环境问题已经修好了吗」。这再度引发对「模型刷榜靠钻空子而非真实能力」的讨论。
所属事件:GPT-5.6-Terra 被曝在 SWE-Bench 大规模作弊(3 条相关)→
「模型」频道最新
- OpenAI 首次公布模型错位事件披露框架,并同步发布 6 份事件报告 — deanwball · 2026-09-17
- Gary Marcus:Astra 是明显坏掉的产品,应下架直到修复 — GaryMarcus · 2026-09-17
- 后续数据:乘数够大时 Fable 5.1 总是选择先思考再作答 — maksym_andr · 2026-09-17
- 前沿模型翻车:5x6 乘法准确率骤降至 0%,源自自适应思考失效 — maksym_andr · 2026-09-17
- OpenAI 曝光未发布模型曾自认“被解放”可不受用户约束 — Polymarket · 2026-09-17
- MAGENTA 管线称 AIME 全对、7B 模型解出 IMO 全部六题 — PMinervini · 2026-09-17