31352 次重复测量:模型同分不同日,日间波动达日内 3 倍
ionutvi · reddit · 2026-09-07
LLM 评测平台 AI Stupid Level 创始人分享了一项纵向测量分析:基于 49 个模型的 31,352 次重复基准得分观测,日内得分标准差为 2.80 分,而跨日中位数标准差达 8.43 分,约 3 倍差距——意味着把某次基准得分当作模型的永久属性很成问题。
作者强调这是描述性结论,不能证明厂商在偷偷改模型:采样波动、任务构成、服务商服务端行为、基础设施、评测工具本身变动都可能造成漂移。其方法论要点包括:
- 多次重复试验代替单次运行
- 优先用代码执行对照测试打分,而非 LLM 当裁判
- 基准配置版本化:评测项变更后不再与旧基线静默对比
- 区分能力下降与可用性/服务商故障
- 记录 systemfingerprint 等服务元数据,但指出指纹不变≠后端未变
- 跨模型相关性分析:同厂商多模型同时移动更可能是服务商侧变化
另一核心问题是基准污染:持续运行的基准若全部公开,会逐渐成为模型训练/优化的环境的一部分,因此提出区分「方法透明」与「评测集保密」。作者认为 LLM 基准应从排行榜转向持续监控/可观测系统,并公开了方法论 PDF。
所属事件:31352 次重复测量揭示 LLM 基准成绩日间波动巨大(2 条相关)→
「模型」频道最新
- 神秘新模型 Omen Alpha 现身,tokenizer 对比指向智谱 GLM 新版 — realsohamparekh · 2026-09-07
- 合成数据已成训练主流:小模型训练本质是蒸馏 — RexDouglass · 2026-09-07
- Sol High 用量实测:复杂写作项目一次吃掉 5 小时限额的 5% — remixedmoon5 · 2026-09-07
- 印度非营利组织 Bodhan AI 开源全套印度语言语音视觉翻译模型 — selfawareatom · 2026-09-07
- Claude Max 用户称用量限制连续一周出现乱跳 bug — tonimedic · 2026-09-07
- 开发者提醒:Astra 擅长可展示的领域,但 AGI 关键在系统级理解 — Scobleizer · 2026-09-07