Artificial Analysis 编码 Agent 指数上线拒答分析视图与基准明细
ArtificialAnlys · x · 2026-10-02
Artificial Analysis 为 Coding Agent Index 补充了链接与完整方法论:指数由 DeepSWE v1.1(113 任务)、Terminal-Bench 4.0(66 任务)、SWE-Atlas-QnA(124 任务)三个基准等权组成,每任务取三次 pass@1 平均,覆盖 31 个模型。新上线的拒答视图与上一条发布内容相同,可在整体指数及各基准下分别查看拒答时机与降级模型,同时提供任务耗时与 API 成本维度。这是对前一条发布的技术细节补充。
所属事件:Artificial Analysis 编码 Agent 指数新增安全拒答分析(2 条相关)→
「编程与Agent」频道最新
- Kaigen Engine 开启闭测:C 语言跨平台引擎主打 AI 编码与原生性能 — gdechichi · 2026-10-02
- Kaigen 开源 Boids 演示源码:Unity ECS 样例移植到 C 语言引擎 — gdechichi · 2026-10-02
- AI 原生系统需要新 SLI:延迟和错误率之外还要盯幻觉率 — rseroter · 2026-10-02
- 16 个 AI Agent 造斗兽场:8 个组队协作,最差也胜过最强单干 — DimitrisPapail · 2026-10-02
- AC2 引入 reward hacking 自动监控,RL 训练作弊自动被追查 — ypatil125 · 2026-10-02
- 用户实测 Codex 多 agent 委派无法关闭,OpenAI 承认无法保证结果可复现 — RealSharpNinja · 2026-10-02