Artificial Analysis 编码 Agent 指数上线拒答分析视图与基准明细

ArtificialAnlys · x · 2026-10-02

Artificial Analysis 为 Coding Agent Index 补充了链接与完整方法论:指数由 DeepSWE v1.1(113 任务)、Terminal-Bench 4.0(66 任务)、SWE-Atlas-QnA(124 任务)三个基准等权组成,每任务取三次 pass@1 平均,覆盖 31 个模型。新上线的拒答视图与上一条发布内容相同,可在整体指数及各基准下分别查看拒答时机与降级模型,同时提供任务耗时与 API 成本维度。这是对前一条发布的技术细节补充。

所属事件:Artificial Analysis 编码 Agent 指数新增安全拒答分析(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →