31352 次重复测量揭示 LLM 基准成绩日间波动巨大

AI Stupid Level 评测平台创始人基于 49 个模型的 31,352 次重复基准测量,提出应把 LLM 基准测试视为纵向测量问题而非排行榜问题。分析发现 API 模型背后的服务设施、配置和版本会随时间变化,单次快照式跑分掩盖了这种漂移;核心结论是模型成绩存在显著的日间波动,其幅度约为日内波动的 3 倍,日内得分标准差约 2.80 分,意味着同分不同日现象普遍。

2026-09-07 ~ 2026-09-07 · 2 条相关