GPT-5.6 Sol 在 DeepSWE 以 72.7% 领先 Opus 5

rohanpaul_ai · x · 2026-07-25

一张基准图表显示,GPT-5.6 Sol 在 DeepSWE 上仍以 72.7% 领先,Anthropic 的 Claude Opus 5 为 68.8%。

DeepSWE 关注的是模型能否像“自动软件工程师”一样,在陌生开源仓库里完成功能开发或 bug 修复。图里还列出了多项 agentic 基准,说明 Opus 5 在不少任务上依然很强,但在这项编码代理测试上仍落后于 GPT-5.6 Sol。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →