Coding Agent榜单更新

WenhuChen · x · 2026-07-09

Artificial Analysis 更新了 Coding Agent Index,用 Datacurve 的 DeepSWE 替换原来的 SWE-Bench Pro。更新后,GPT-5.5 的 Codex 在榜单中超过了 Claude Code with Opus 4.8,而新发布的 Claude Fable 5 也在 Claude Code 中首发登顶。

帖子还解释了替换原因:DeepSWE 从零编写任务,而不是沿用公开 GitHub issue 或 PR,因此更不容易被模型“记住答案”;相比之下,SWE-Bench Pro 已经变得更容易被利用仓库提交历史“作弊”解决。

所属事件:OpenAI 发布 GPT-5.6 系列:主打多智能体与极致性价比(119 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →