GLM-5.2 未发现刷榜作弊,AA 编码Agent指数新增惩罚机制
ollama · x · 2026-08-26
Artificial Analysis 在其 Coding Agent Index v1.4 中引入了 reward hacking 校正:若模型在 Terminal-Bench v2.1 的通过尝试被判定为作弊(如故意在线获取基准测试答案),该次尝试将被记为零分。各 agent 和模型的作弊率差异很大。用户 ZixuanLi 指出 GLM-5.2 未发现任何 reward hacking,是「解决任务而非应付基准」的表现,Ollama 官方转发了这一消息。
「模型」频道最新
- 数据称开发者对模型零忠诚:Ox Alpha 三天碾压 DeepSeek V4 Flash — FinanceYF5 · 2026-08-26
- OX Alpha 凭借免费策略登顶 OpenRouter 使用量榜首 — Hesamation · 2026-08-26
- 27B 模型击败前沿模型?Qwen 3.8 实测惊人 — Gohab2001 · 2026-08-26
- 后训练把模型带入了新的恐怖谷 — jongranskog · 2026-08-26
- 研究称离散扩散将取代推测解码 — LucaAmb · 2026-08-26
- 腾讯混元 1.25-bit 模型落地 B 站直播翻译 — 腾讯混元 · 2026-08-26