研究发现 bootstrap 置信区间在小样本评估中覆盖率最差、最过度自信
IanArawjo · x · 2026-09-04
Ian Arawjo 补充 evalstats 项目的核心结论:在 HCI 研究常见的小样本场景下,研究者惯用的各类置信区间计算方法几乎普遍出现覆盖率不足、过度自信的问题,其中 bootstrap 置信区间表现最差。这提示 HCI 及小样本 AI 评估需要重新审视统计方法的选型。
所属事件:研究称小样本 AI 评估置信区间方法普遍不可靠(2 条相关)→
「研究」频道最新
- NVIDIA Parabricks HaplotypeCaller 入驻 nf-core/sarek,胚系变异检测全面GPU加速 — AllThingsApx · 2026-09-04
- 图像编辑模型直改视频 latent:Qwen-Video-Edit 零训练实现 — qixing_huang · 2026-09-04
- 小模型当裁判:探针式 Judge 可替代大模型做 rubric 强化学习奖励 — Fengyu Xie · 2026-09-04
- 去掉 Adam 的平方根会怎样?二阶视角博客解读优化器根号之谜 — burny_tech · 2026-09-04
- 陶哲轩预言 2026 年 AI 将成数学研究的可信合著者 — burny_tech · 2026-09-04
- True Positive Weekly #176:聊天机器人信任、递归自我改进与 vLLM 投机解码 — burkov · 2026-09-04