LiveBench 基准测试易被刷榜,2.0 版开发中

Bindu Reddy 指出 AI 编码基准测试 LiveBench 存在严重刷榜问题,模型可针对特定测试过度优化导致得分虚高,例如排行榜上出现 Qwen 27B 超越 GPT 5.6 等不可信结果,甚至能力较差的模型排名反超更强模型。对此,团队正在开发更难被刷榜的 LiveBench 2.0 版本。

2026-08-23 ~ 2026-08-23 · 2 条相关