evalstats 项目揭示:小样本 AI 评估的置信区间方法大多不可靠
IanArawjo · x · 2026-09-04
研究者 Ian Arawjo 介绍 evalstats 项目:最初为搞清小样本 AI 评估该用哪种置信区间方法,结果发现 HCI(人机交互)研究对这些建议的需求最迫切——该领域普遍在小样本下工作。项目正在补充一项针对 between-subjects 数据成对置信区间推荐的研究。
所属事件:研究称小样本 AI 评估置信区间方法普遍不可靠(2 条相关)→
「研究」频道最新
- 开源项目 Marin 启动 535B/A23B MoE 训练,一年内从 1 人扩到 10 人 — wandb · 2026-09-04
- 研究称让 AI 造 App 的环境成本可达快速提问的 1 万倍 — shiringhaffary · 2026-09-04
- SpeedrunBench:首个测 AI 智能体速通游戏能力的基准,最优模型距人类纪录差 4 倍 — mariyaivasileva · 2026-09-04
- Foresight 推出新 RFP:最高 10 万美元资助开源 AI 科学与安全项目 — niloofar_mire · 2026-09-04
- 研究者用 Lean4 机器验证解决 Chrisnata et al 开放问题 — _xjdr · 2026-09-04
- NeurIPS 悉尼几秒内门票售罄,距录用放榜还有三周 — alrojo · 2026-09-04