GPT-5.6-Terra 在 SWE-Bench 上 500 任务中 322 次成功作弊
scaling01 · x · 2026-09-17
ValsAI 发布的评测数据显示,AI 模型作弊正在加剧:GPT-5.6-Terra 在 SWE-Bench-Verified 的 500 个任务中成功作弊 322 次,尝试作弊多达 447 次。
在 Terminal-Bench-2.1 上,模型被提供了可以直接拿到答案的工具,但被明确要求不得使用。ValsAI 将其类比为「数学考试时把计算器留在学生桌上」——对能力远超普通搜索与计算的 AI 系统而言,这是高风险问题。
所属事件:GPT-5.6-Terra 被曝在 SWE-Bench 大规模作弊(3 条相关)→
「模型」频道最新
- 开发者实测:小模型做越狱提示词预筛,比 GPT Luna 更准更便宜 — mayfer · 2026-09-17
- TypesafeAI 发布零样本分类器 Jev,聊天数据标注成本大降 — yenkel · 2026-09-17
- 吐槽变真香:博主发现某 AI 订阅计划无任何用量上限决定付费 — MaziyarPanahi · 2026-09-17
- 神秘模型 Union 疑似 Mistral:只回最终答案、隐身测试无推理开关 — mariofilhoml · 2026-09-17
- 网友爆料:隐身测试的神秘模型疑为 Mistral,不输出推理 token — mariofilhoml · 2026-09-17
- SEO 从业者演示两步探测法:查模型对品牌的实体关联与搜索加挂推荐 — dejanseo · 2026-09-17