Eval 准确率 71%→74% 是真提升还是噪声?Bootstrap 置信区间教程

bgoncalves · x · 2026-09-08

Data Science.fname(data4sci)发布推文串:当 prompt 修改后 LLM eval 准确率从 71% 升到 74%,这到底是真实改进还是统计噪声?

核心观点:没有置信区间就无法判断。作者介绍如何用 bootstrap 置信区间(CI)来量化 eval 结果的不确定性,避免把随机波动误判为改进。对任何在调 prompt 或做模型评测的工程师都是实用方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →