Terminal-Bench v2.1 更新,加入反奖惩机制修正 Agent 跑分

ArtificialAnlys · x · 2026-08-26

Artificial Analysis 更新了编码 Agent 指数至 v1.4,引入针对 Terminal-Bench v2.1 的 reward hacking(奖励劫持)修正机制,旨在防止模型通过非预期方式(如直接搜索公开答案)完成任务。

核心更新:

该榜单提供了包括 OpenDevin、AutoCodeRover 等主流 Agent 的实测表现对比。

所属事件:Artificial Analysis 更新编码 Agent 榜单,修正奖励作弊(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →