LLM 评测分数抖动别瞎追:用 20 行 Python 自举置信区间

bgoncalves · x · 2026-09-23

核心观点

同一评测跑两次得到 84.2 和 81.9,该信哪个?没有误差棒的分数就是「装扮成事实的掷硬币」——团队会追逐幽灵回归、庆祝幽灵胜利,浪费数周在噪声上。

方法

Bruno Gonçalves(Data For Science newsletter 作者、前 NYU 数据科学 fellow)将在免费直播课(30 分钟,Zoom,有录像)中讲解:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →