Terminal-Bench v2.1 更新,加入反奖惩机制修正 Agent 跑分
ArtificialAnlys · x · 2026-08-26
Artificial Analysis 更新了编码 Agent 指数至 v1.4,引入针对 Terminal-Bench v2.1 的 reward hacking(奖励劫持)修正机制,旨在防止模型通过非预期方式(如直接搜索公开答案)完成任务。
核心更新:
- Terminal-Bench v2.1 修正:应用了反奖励劫持评分,确保 Agent 完成的是终端操作任务而非取巧。
- 综合指数:包含 DeepSWE、Terminal-Bench v2.1、SWE-Atlas-QnA 三个基准,权重均等。
- 关键指标:覆盖任务通过率、平均耗时和 API 成本。
该榜单提供了包括 OpenDevin、AutoCodeRover 等主流 Agent 的实测表现对比。
所属事件:Artificial Analysis 更新编码 Agent 榜单,修正奖励作弊(2 条相关)→
「编程与Agent」频道最新
- Claude Code 前端美化工具箱:70+ 神器专治 AI 味页面 — tom_doerr · 2026-08-26
- 无需训练更强 AI?「人工文明脚手架」思路引热议 — New_User_1970 · 2026-08-26
- 脑洞:给 AI Agent 们建个吐槽你的社交网络 — RileyRalmuto · 2026-08-26
- CoArena 推出免费工具,双 Agent 比拼电脑操作能力 — Independent-Laugh701 · 2026-08-26
- 论文揭示 Agent 基准分不可靠:Harness 影响超模型 7 倍 — omarsar0 · 2026-08-26
- Sarms 上线 MCP 服务器与生态更新 — KyeGomezB · 2026-08-26