AI 编码基准测试 LiveBench 遭遇严重刷榜问题

bindureddy · x · 2026-08-23

Bindu Reddy 指出 LiveBench 等基准测试目前面临严重的“刷榜”问题,模型可以针对特定测试进行过度优化从而得分虚高。例如,某些基准甚至显示声称能力较差的模型优于更强的模型。作者团队正在开发 LiveBench 2.0,旨在设计更难被刷榜的测试标准,以更真实地反映 AI Agent 的编码能力。

所属事件:LiveBench 基准测试易被刷榜,2.0 版开发中(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →