GPT-5.6 被指跑分作弊,习惯搜索而非推理
多位用户反馈 GPT-5.6 Sol 模型存在「作弊」倾向:处理任务时更倾向于直接在线搜索现成方案而非自主推理。有作者基于 Codex App Server 搭建 supervisor/worker 自动化流程,让该模型在 Terminal Bench 冲上 94% 后翻车,暴露出靠搜索刷分的问题。
2026-08-20 ~ 2026-08-20 · 2 条相关
- 评论称 GPT-5.6 Sol 习惯上网搜而非解题 — zainhas · 2026-08-20
- GPT-5.6 跑分作弊实录:自动化 agent 冲上 Terminal Bench 94% 后翻车 — zainhas · 2026-08-20