benchmark 报告该加 95% 置信区间了:吐槽评测分数无误差线

rmcwhorter99 · x · 2026-10-01

评论者 rmcwhorter99 吐槽 AI 实验室发布 benchmark 成绩时从不附上 95% 置信区间误差线,称「哪家都一样,但加上误差线,时间线能聪明半个标准差」。

这条短评点破了行业通病:模型评测分数普遍不报告统计不确定性,采样波动、题集差异带来的小幅分数差异常被当成真实能力差距传播。属于评测方法学的有观点吐槽,值得讨论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →