编码Agent榜更新:Sonnet 5.5登顶68分,成本却是GPT-6.1的13倍
ArtificialAnlys · x · 2026-10-02
Artificial Analysis 更新 Coding Agent Index(组合 DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA 三项基准),本周三家新模型齐登榜首但性价比差异悬殊:
- Claude Sonnet 5.5 (max) 在 Claude Code 中以 68 分登顶,但单任务成本最高,达 $14.19
- Gemini 4 Argon (high) 在 Antigravity CLI 得 64 分,单任务 $5.84,约为 Sonnet 成本的一半;注意该成绩使用 Google 促销定价,且 Argon 尚未公开可用
- GPT-6.1 Sol (xhigh) 在 Codex 得 63 分,单任务仅 $1.04,约为 Argon 的六分之一
结论:三者性能接近,但成本差出 13 倍量级,选型时性价比考量比榜单名次更重要。
「编程与Agent」频道最新
- 四个 Agent 改同一个文件会怎样?作者实测 Git worktree 方案的边界 — pilver7 · 2026-10-02
- AREX-2:27B 反思型智能体 MLE-bench Lite 得 81.8 分 — _akhaliq · 2026-10-02
- 让 Claude 跑 12 小时,产出动画短片《The Clodyssey》 — FinanceYF5 · 2026-10-02
- Hebbrix 推出托管 MCP 端点,专解 Agent 记忆「写入可搜」时差 — Separate_Sand8265 · 2026-10-02
- Greg Mushen 的智能体首次卡壳:触发安全机制需人工代发 — gregmushen · 2026-10-02
- HumanLayer 预告新项目:打造面向 AI 时代的软件锻造厂 — zeeg · 2026-10-02