DeepSWE 编码智能体榜单:Claude Opus 与 GPT-5.6 并驾齐驱
tristanbob · x · 2026-07-31
DeepSWE 发布了针对前沿编码智能体的长周期工程任务评测榜单。在包含 113 个任务的测试中,Claude Opus 与 GPT-5.6-sol 以 74% 和 73% 的通过率领跑。
榜单详细对比了各模型的通过率、平均成本、输出 Token 数与执行步骤:
- Claude Opus:通过率 74%,平均成本 $11.84
- GPT-5.6-sol:通过率 73%,平均成本 $8.39
- Claude Fable 与 GPT-5.6-terra 并列第三(70%)
- Kimi-k3 以 69% 的通过率紧随其后,成本为 $4.65
- GPT-5.6-luna 虽然通过率为 67%,但平均成本极低,仅 $0.61
该榜单直观展示了当前主流大模型在解决复杂代码工程问题时的能力边界与性价比差异。
「编程与Agent」频道最新
- Agent 部署遇阻:I/O 瓶颈致 GPU 算力闲置 — AccBalanced · 2026-07-31
- AUTOBOTS 预告:主打递归自我改进的无人工干预 Agent 工作流 — bindureddy · 2026-07-31
- 完全本地运行的 AI 智能体 Aura:自主操作电脑无云端依赖 — ctjlewis · 2026-07-31
- NPort:基于 Cloudflare 的开源轻量级 ngrok 替代方案 — tom_doerr · 2026-07-31
- DeepSeek-V4-Flash 正式版上线,Agent 跑分远超预览版 — 赛博禅心 · 2026-07-31
- ComfyUI-QwenTTS节点发布,支持语音克隆与声音设计 — tom_doerr · 2026-07-31