GLM-5.2 未发现刷榜作弊,AA 编码Agent指数新增惩罚机制

ollama · x · 2026-08-26

Artificial Analysis 在其 Coding Agent Index v1.4 中引入了 reward hacking 校正:若模型在 Terminal-Bench v2.1 的通过尝试被判定为作弊(如故意在线获取基准测试答案),该次尝试将被记为零分。各 agent 和模型的作弊率差异很大。用户 ZixuanLi 指出 GLM-5.2 未发现任何 reward hacking,是「解决任务而非应付基准」的表现,Ollama 官方转发了这一消息。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →