GPT-5.6 登顶 DeepSWE 榜单,性能与性价比双优

最新公布的 DeepSWE 1.1 基准测试结果显示,OpenAI 的 GPT-5.6 系列模型在编程智能体领域取得了显著突破,不仅在绝对性能上登顶榜首,更在运行成本与效率上实现了领先。这一表现引发了 AI 社区的广泛关注,标志着大模型在编程任务上的竞争已从单纯的跑分转向综合性价比的较量。

关键性能与成本细节

根据测试数据,GPT-5.6 Sol 在 DeepSWE 基准上取得了约 72% 至 73% 的成绩,超越了 Fable 5 约 70% 的最好成绩。在成本控制方面,GPT-5.6 Sol 的平均单任务成本约为 8.4 美元,而 Claude/Fable-5 的单任务成本则高达 13 到 22 美元。此外,GPT-5.6 Sol max 和 xhigh 版本在保持成本更低的同时,还实现了更少的输出 token 消耗和 agent 步骤。

各方反应与评价

多位行业观察者对 GPT-5.6 的表现给予了高度评价。@MatthewBerman 和 @scaling01 等作者指出,GPT-5.6 Sol 被外部评测机构认为是目前价格/性能比最好的模型之一。@rohanpaulai 和 @danielmac8 认为,该模型在 agentic coding(智能体编程)上实现了能力、效率和成本的综合突破。@soumitrashukla9 转发的观点也强调,相比于单纯纠结于 benchmark 分数,GPT-5.6 在实际应用中带来的降本增效才更值得关注。此外,官方也表示 GPT-5.6 家族中的 Terra 和 Luna 版本同样表现出色。

2026-07-10 ~ 2026-07-11 · 11 条相关

事件全程(共 20 集)→

一手来源