编码智能体评测方法:Artificial Analysis 指数如何算
ArtificialAnlys · x · 2026-09-03
Artificial Analysis 公布其编码智能体榜单的完整数据与方法:Coding Agent Index v1.4 由三个基准加权平均——DeepSWE(Datacurve,113 道软件工程任务)、Terminal-Bench v2.1(Laude Institute,89 道 agent 终端任务)、SWE-Atlas-QnA(Scale AI,124 道技术问答);每项按三次尝试的 pass@1 平均,三个基准等权合成指数。榜单同时呈现单任务平均耗时与单任务 API 成本,官方提醒指数相近的智能体在各子项上仍可能强弱分明,应结合分项 breakdown 阅读。
「研究」频道最新
- DeepMind Petar Veličković 讲《范畴深度学习:架构的代数理论》 — burny_tech · 2026-09-03
- DeepMind Petar Veličković 讲《范畴深度学习:架构的代数理论》 — burny_tech · 2026-09-03
- NSF 续资哥伦比亚 AI 地球系统建模中心五年,初始资助 2500 万美元 — vishalmisra · 2026-09-03
- 合作 AI 研究组织发布《Priorities in Cooperative AI》演讲 — ghadfield · 2026-09-03
- AirCaps 推出音频研究实验室:噪声下语音识别 WER 高达 20% — ycombinator · 2026-09-03
- SPAR 用 RCT 实测:带隐藏目标的 AI 能否悄悄操纵人类决策 — austinc3301 · 2026-09-03