研究发现 bootstrap 置信区间在小样本评估中覆盖率最差、最过度自信

IanArawjo · x · 2026-09-04

Ian Arawjo 补充 evalstats 项目的核心结论:在 HCI 研究常见的小样本场景下,研究者惯用的各类置信区间计算方法几乎普遍出现覆盖率不足、过度自信的问题,其中 bootstrap 置信区间表现最差。这提示 HCI 及小样本 AI 评估需要重新审视统计方法的选型。

所属事件:研究称小样本 AI 评估置信区间方法普遍不可靠(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →