GPT-5.6在DeepSWE领先且更省

rohanpaul_ai · x · 2026-07-10

GPT-5.6 Sol 在 DeepSWE 编程智能体基准上取得约 72% 到 73% 的成绩,平均每个任务成本约 8.4 美元。Claude/Fable-5 的最好成绩约 70%,但单任务成本更高,约 13 到 22 美元。

帖子还解释了 DeepSWE 的测法:它要求模型在真实开源仓库里完成长软件工程任务,不是普通代码补全。评测会检查最终补丁是否真的可用,考察仓库导航、缺陷诊断、代码编辑、工具使用、测试运行和多步修复能力。

所属事件:GPT-5.6 登顶 DeepSWE 榜单,性能与性价比双优(11 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →