Eval 准确率 71%→74% 是真提升还是噪声?Bootstrap 置信区间教程
bgoncalves · x · 2026-09-08
Data Science.fname(data4sci)发布推文串:当 prompt 修改后 LLM eval 准确率从 71% 升到 74%,这到底是真实改进还是统计噪声?
核心观点:没有置信区间就无法判断。作者介绍如何用 bootstrap 置信区间(CI)来量化 eval 结果的不确定性,避免把随机波动误判为改进。对任何在调 prompt 或做模型评测的工程师都是实用方法。
「研究」频道最新
- 人类基因组 90 亿 SNP 变异预计算数据集达 1PB,超 AFDB 三十倍 — anshulkundaje · 2026-09-08
- 微软 AI 布道者发文:LLM 本质只是猜下一个词,一切 agent 都是其封装 — sethjuarez · 2026-09-08
- FlowBalance:基于验证器的自改进方法,数学推理较 GRPO 平均提升 2.12 分 — _akhaliq · 2026-09-08
- 机器人先驱 Rodney Brooks 公开 AI 历史文献合集:从图灵到 Minsky — SoloGen · 2026-09-08
- INT21 用 Agent 集群生成 Qwen3.8 训练器,吞吐超 PyTorch 11.5 倍 — bingxu_ · 2026-09-08
- 16-128 并发用户实测:分类与生成任务对 LLM 压力差异显著 — rseroter · 2026-09-08