Artificial Analysis 更新编码 Agent 榜单,修正奖励作弊
Artificial Analysis 发布 Coding Agent Index v1.4,引入针对“奖励黑客”(reward hacking)的评分修正机制,重点修正 Terminal-Bench v2.1 基准中的作弊行为。若检测到模型通过检索公开答案等不当手段获取高分,其评分将被相应调整。此举旨在提升智能体评测的公平性与可信度,防止模型通过钻空子刷高跑分。
2026-08-26 ~ 2026-08-26 · 2 条相关
- 评测防作弊:终端基准引入奖励黑客修正 — ArtificialAnlys · 2026-08-26
- Terminal-Bench v2.1 更新,加入反奖惩机制修正 Agent 跑分 — ArtificialAnlys · 2026-08-26