研究称小样本 AI 评估置信区间方法普遍不可靠

研究者 Ian Arawjo 发布 evalstats 项目,最初旨在厘清小样本 AI 评估应采用哪种置信区间方法,结果发现 HCI(人机交互)领域对这些建议的需求最迫切。核心结论是:在 HCI 常见的小样本场景下,研究者惯用的各类置信区间计算方法几乎普遍存在覆盖率不足、过度自信的问题,其中 bootstrap 方法覆盖率最差、最过度自信。

2026-09-04 ~ 2026-09-04 · 2 条相关