编码智能体评测方法:Artificial Analysis 指数如何算

ArtificialAnlys · x · 2026-09-03

Artificial Analysis 公布其编码智能体榜单的完整数据与方法:Coding Agent Index v1.4 由三个基准加权平均——DeepSWE(Datacurve,113 道软件工程任务)、Terminal-Bench v2.1(Laude Institute,89 道 agent 终端任务)、SWE-Atlas-QnA(Scale AI,124 道技术问答);每项按三次尝试的 pass@1 平均,三个基准等权合成指数。榜单同时呈现单任务平均耗时与单任务 API 成本,官方提醒指数相近的智能体在各子项上仍可能强弱分明,应结合分项 breakdown 阅读。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →