LLM 评测分数抖动别瞎追:用 20 行 Python 自举置信区间
bgoncalves · x · 2026-09-23
核心观点
同一评测跑两次得到 84.2 和 81.9,该信哪个?没有误差棒的分数就是「装扮成事实的掷硬币」——团队会追逐幽灵回归、庆祝幽灵胜利,浪费数周在噪声上。
方法
Bruno Gonçalves(Data For Science newsletter 作者、前 NYU 数据科学 fellow)将在免费直播课(30 分钟,Zoom,有录像)中讲解:
- 用 bootstrap 对任意指标(准确率、成本、延迟)构建置信区间:重采样一千次只需约 20 行 Python,无需分布假设
- 解释相同配置下分数波动的原因:温度、采样和 judge 方差都会造成 run-to-run 波动
- 把单一分数变成可辩护的区间,报告经得起审视
「编程与Agent」频道最新
- 15 年投放老手自建广告 MCP:接 14 个平台,写入默认暂停 — DapperManagement1306 · 2026-09-23
- 资深工程师:agent 开发 90% 精力应花在规划上 — doodlestein · 2026-09-23
- Tim Dettmers 开源 CliffCompaction:两条命令管理 AI 编码上下文压缩 — Tim_Dettmers · 2026-09-23
- CliffCompaction 两行命令接入 Codex,开源模型压缩更优 — Tim_Dettmers · 2026-09-23
- Dettmers:CliffCompaction 配合完整思维链效果更好 — Tim_Dettmers · 2026-09-23
- Dettmers:配上 CliffCompaction,开源模型长程能力反超闭源 — Tim_Dettmers · 2026-09-23