31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍

ionutvi · reddit · 2026-09-07

一位评测平台创始人提出把 LLM 基准测试当作纵向测量问题而非排行榜问题:API 模型背后的服务设施、配置和版本会随时间变化,单次快照式跑分掩盖了这种漂移。

核心发现:

方法论要点:

作者还就纵向评测的时间序列单位、如何区分真实模型漂移与基础设施影响、基准保密边界、变化点检测的替代方案等问题征求业内意见。

所属事件:31352 次重复测量揭示 LLM 基准成绩日间波动巨大(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →