GPT-5.6 Sol 在 DeepSWE 以 72.7% 领先 Opus 5
rohanpaul_ai · x · 2026-07-25
一张基准图表显示,GPT-5.6 Sol 在 DeepSWE 上仍以 72.7% 领先,Anthropic 的 Claude Opus 5 为 68.8%。
DeepSWE 关注的是模型能否像“自动软件工程师”一样,在陌生开源仓库里完成功能开发或 bug 修复。图里还列出了多项 agentic 基准,说明 Opus 5 在不少任务上依然很强,但在这项编码代理测试上仍落后于 GPT-5.6 Sol。
「编程与Agent」频道最新
- 单条提示词生成3D游戏,Opus 5 编程能力惊艳 — chrisfirst · 2026-07-25
- 用代理拦截所有调用,能高效调试 agent 技能 — Daniel_Farinax · 2026-07-25
- Nimbus 发布:面向智能体的开源 Astro 文档框架 — irvinebroque · 2026-07-25
- 创意机构实战:用Slack集成AI Agent自动化素材收集 — beechinour · 2026-07-25
- Anaconda 联手 Kilo Code 把编码智能体带进企业工作流 — anacondainc · 2026-07-25
- OcularAudio MCP 让 agent 本地读取 YouTube 字幕和截图 — Carbon-B · 2026-07-25