研究称小样本 AI 评估置信区间方法普遍不可靠
研究者 Ian Arawjo 发布 evalstats 项目,最初旨在厘清小样本 AI 评估应采用哪种置信区间方法,结果发现 HCI(人机交互)领域对这些建议的需求最迫切。核心结论是:在 HCI 常见的小样本场景下,研究者惯用的各类置信区间计算方法几乎普遍存在覆盖率不足、过度自信的问题,其中 bootstrap 方法覆盖率最差、最过度自信。
2026-09-04 ~ 2026-09-04 · 2 条相关
- evalstats 项目揭示:小样本 AI 评估的置信区间方法大多不可靠 — IanArawjo · 2026-09-04
- 研究发现 bootstrap 置信区间在小样本评估中覆盖率最差、最过度自信 — IanArawjo · 2026-09-04