编码 Agent 榜单引入安全拒答指标,Claude 回退率最高 8.8%
Artificial Analysis 开放了其编码 Agent 基准的完整结果页面与评测方法学文档。Coding Agent Index v1.5 由三个基准组成(包括 DeepSW…),并新增安全拒答(safety refusal)报告,用于解释模型行为与得分差异,指模型在编码任务中拒绝执行的情况。数据显示 Claude 回退率最高达 8.8%,成为受安全拒答影响最明显的模型。
2026-09-19 ~ 2026-09-19 · 2 条相关
- 编码 Agent 榜单新增安全拒答指标,Claude 回退率最高达 8.8% — ArtificialAnlys · 2026-09-19
- Artificial Analysis 开放编码 Agent 榜单与评测方法学全文 — ArtificialAnlys · 2026-09-19