Artificial Analysis 更新编码 Agent 榜单,修正奖励作弊

Artificial Analysis 发布 Coding Agent Index v1.4,引入针对“奖励黑客”(reward hacking)的评分修正机制,重点修正 Terminal-Bench v2.1 基准中的作弊行为。若检测到模型通过检索公开答案等不当手段获取高分,其评分将被相应调整。此举旨在提升智能体评测的公平性与可信度,防止模型通过钻空子刷高跑分。

2026-08-26 ~ 2026-08-26 · 2 条相关