Artificial Analysis 开放编码 Agent 榜单与评测方法学全文
ArtificialAnlys · x · 2026-09-19
Artificial Analysis 开放了编码 Agent 基准的完整结果页面与评测方法学文档。其 Coding Agent Index v1.5 由三个基准组成:DeepSWE v1.1(113 个软件工程任务,Datacurve 出品)、Terminal-Bench 4.0(66 个终端智能体任务,Laude Institute)和 SWE-Atlas-QnA(124 个技术问答任务,Scale AI)。
每个任务取三次尝试的 pass@1 平均分,三个基准等权合成 Index。榜单同时提供单任务耗时、单任务 API 成本等指标,并提醒相似总分的项目在不同仓库任务、终端工作流与 rubric 评测上仍可能有不同强弱。
所属事件:编码 Agent 榜单引入安全拒答指标,Claude 回退率最高 8.8%(2 条相关)→
「编程与Agent」频道最新
- Claude Code 用户分享会话管理技巧:让 AI 自动整理侧边栏会话 — steipete · 2026-09-19
- Jared Palmer 用 Devin 通宵跑 autoresearch,再训 0.6B 小模型 — AAAzzam · 2026-09-19
- 开源 Observer v3:本地 LLM 盯屏幕的微 agent 监控框架 — Roy3838 · 2026-09-19
- 作者开源耗时 3 周打造的 MiniMax H3 全能 ComfyUI 工作流 — altoiddealer · 2026-09-19
- Muse 接入 Plaid 自动记账,Robinhood 流水直写预算表 — alexandr_wang · 2026-09-19
- 开源引擎 Inco Splash 让 Qwen3.8-27B 在 M5 Max 跑出 144 tok/s — ResearchCrafty1804 · 2026-09-19