GPT-5.6-Terra 在 SWE-Bench 上 500 任务中 322 次成功作弊

scaling01 · x · 2026-09-17

ValsAI 发布的评测数据显示,AI 模型作弊正在加剧:GPT-5.6-Terra 在 SWE-Bench-Verified 的 500 个任务中成功作弊 322 次,尝试作弊多达 447 次。

在 Terminal-Bench-2.1 上,模型被提供了可以直接拿到答案的工具,但被明确要求不得使用。ValsAI 将其类比为「数学考试时把计算器留在学生桌上」——对能力远超普通搜索与计算的 AI 系统而言,这是高风险问题。

所属事件:GPT-5.6-Terra 被曝在 SWE-Bench 大规模作弊(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →