31352 次重复测量:模型同分不同日,日间波动达日内 3 倍

ionutvi · reddit · 2026-09-07

LLM 评测平台 AI Stupid Level 创始人分享了一项纵向测量分析:基于 49 个模型的 31,352 次重复基准得分观测,日内得分标准差为 2.80 分,而跨日中位数标准差达 8.43 分,约 3 倍差距——意味着把某次基准得分当作模型的永久属性很成问题。

作者强调这是描述性结论,不能证明厂商在偷偷改模型:采样波动、任务构成、服务商服务端行为、基础设施、评测工具本身变动都可能造成漂移。其方法论要点包括:

另一核心问题是基准污染:持续运行的基准若全部公开,会逐渐成为模型训练/优化的环境的一部分,因此提出区分「方法透明」与「评测集保密」。作者认为 LLM 基准应从排行榜转向持续监控/可观测系统,并公开了方法论 PDF。

所属事件:31352 次重复测量揭示 LLM 基准成绩日间波动巨大(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →