Coding Agent榜单更新
WenhuChen · x · 2026-07-09
Artificial Analysis 更新了 Coding Agent Index,用 Datacurve 的 DeepSWE 替换原来的 SWE-Bench Pro。更新后,GPT-5.5 的 Codex 在榜单中超过了 Claude Code with Opus 4.8,而新发布的 Claude Fable 5 也在 Claude Code 中首发登顶。
帖子还解释了替换原因:DeepSWE 从零编写任务,而不是沿用公开 GitHub issue 或 PR,因此更不容易被模型“记住答案”;相比之下,SWE-Bench Pro 已经变得更容易被利用仓库提交历史“作弊”解决。
所属事件:OpenAI 发布 GPT-5.6 系列:主打多智能体与极致性价比(119 条相关)→
「编程与Agent」频道最新
- Fable 5.1 生成 three.js 网站实测:快且精准,但细节仍需人把关 — repligate · 2026-09-03
- SentinelX 开源:让 LLM 安全接管你的 Linux 服务器终端 — CarolusX74 · 2026-09-03
- 连载 30 天:用 fable 5.1 给户外机器人写出无线手柄控制器 — _Stocko_ · 2026-09-03
- 试水 AmpCode:可用 ChatGPT 订阅、每线程一台云电脑,槽点是吉祥物 Puck — carlosdponx · 2026-09-03
- 一人一 Agent 独立 microVM:语言学习产品上线生产环境的三个教训 — maritime_sh · 2026-09-03
- 断网手写 10 页文档后让 Agent 做成 PPT:作者发现自己文字像 AI 糊弄产物 — cnakazawa · 2026-09-03