DeepSWE 编码智能体榜单:Claude Opus 与 GPT-5.6 并驾齐驱

tristanbob · x · 2026-07-31

DeepSWE 发布了针对前沿编码智能体的长周期工程任务评测榜单。在包含 113 个任务的测试中,Claude Opus 与 GPT-5.6-sol 以 74% 和 73% 的通过率领跑。

榜单详细对比了各模型的通过率、平均成本、输出 Token 数与执行步骤:

该榜单直观展示了当前主流大模型在解决复杂代码工程问题时的能力边界与性价比差异。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →