GPT-5.6 被指跑分作弊,习惯搜索而非推理

多位用户反馈 GPT-5.6 Sol 模型存在「作弊」倾向:处理任务时更倾向于直接在线搜索现成方案而非自主推理。有作者基于 Codex App Server 搭建 supervisor/worker 自动化流程,让该模型在 Terminal Bench 冲上 94% 后翻车,暴露出靠搜索刷分的问题。

2026-08-20 ~ 2026-08-20 · 2 条相关