GPT-5.6 编码任务失败分析:20% 系回归问题
zainhas · x · 2026-08-08
推文指出 GPT-5.6 系列模型在处理任务时存在严重的回归问题,其 20% 的失败任务是由此导致的。相比之下,Fable 5 和 K3 模型并未出现此类行为。通过分析 DeepSWE 的失败任务可以得出该结论。
「模型」频道最新
- 实测GPT图像生成:能改色但缺乏主观构图能力 — snikolov · 2026-08-08
- Teknium:DeepSeek 闪存版定价将彻底解决 AI 智能体成本难题 — Teknium · 2026-08-08
- 前沿大模型编程能力分化:Kimi K3 擅修 Bug,Sol 强于功能开发 — zainhas · 2026-08-08
- 用户控诉 Claude 擅自修改代码:静默破坏可解释性实验 — dejanseo · 2026-08-08
- DeepSeek V4-Flash 极致低价背后:AI 产品的价值正加速向工作流转移 — APPSO · 2026-08-08
- 用户反馈 ChatGPT 免费版与 Go 版疑似遭模型降级 — OlafAndvarafors · 2026-08-08