31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍
ionutvi · reddit · 2026-09-07
一位评测平台创始人提出把 LLM 基准测试当作纵向测量问题而非排行榜问题:API 模型背后的服务设施、配置和版本会随时间变化,单次快照式跑分掩盖了这种漂移。
核心发现:
- 覆盖 49 个模型、31352 次重复分数观测
- 同一天内分数标准差为 2.80 分,不同日期的日中位数标准差达 8.43 分,约 3:1
- 作者强调这不足以证明厂商在逐日改模型,混杂因素太多,但足以说明时间维度的变化值得被测量而非当作噪声
方法论要点:
- 基准配置版本化,只在兼容条件下比较纵向观测
- 尽量用可重复的执行式评测而非 LLM 裁判
- 把可用性故障与有效任务结果分开记录,跟踪服务/版本元数据,对时间序列做变化点检测
- 关注基准识别与污染问题:公开全部在线任务本身会改变被测对象,因此公开方法设计但隐藏在线题库
作者还就纵向评测的时间序列单位、如何区分真实模型漂移与基础设施影响、基准保密边界、变化点检测的替代方案等问题征求业内意见。
所属事件:31352 次重复测量揭示 LLM 基准成绩日间波动巨大(2 条相关)→
「模型」频道最新
- Astra 自估距 AGI 很远,但配上工具使用后评分接近 — kevinnbass · 2026-09-07
- GLM 5.3、Qwen 3.8 可在单机本地流畅运行 — jasonkneen · 2026-09-07
- 新基准测模型自我建模:开源模型经RL提升但反事实仍易错 — dair_ai · 2026-09-07
- Alexandr Wang 点评 Muse Spark 1.3:时间跨度比肩 GPT-5.6 — alexandr_wang · 2026-09-07
- 实测者泼冷水:Astra 展示强但单步推理仍够不到研究级 — xiaosun86 · 2026-09-07
- GPT-6 Astra 生成导弹规避模拟视频,能力惊人 — algo_diver · 2026-09-07