Artificial Analysis 开放编码 Agent 榜单与评测方法学全文

ArtificialAnlys · x · 2026-09-19

Artificial Analysis 开放了编码 Agent 基准的完整结果页面与评测方法学文档。其 Coding Agent Index v1.5 由三个基准组成:DeepSWE v1.1(113 个软件工程任务,Datacurve 出品)、Terminal-Bench 4.0(66 个终端智能体任务,Laude Institute)和 SWE-Atlas-QnA(124 个技术问答任务,Scale AI)。

每个任务取三次尝试的 pass@1 平均分,三个基准等权合成 Index。榜单同时提供单任务耗时、单任务 API 成本等指标,并提醒相似总分的项目在不同仓库任务、终端工作流与 rubric 评测上仍可能有不同强弱。

所属事件:编码 Agent 榜单引入安全拒答指标,Claude 回退率最高 8.8%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →