LLM评测统计避坑:为何Mann-Whitney U检验不适合处理Likert数据
IanArawjo · x · 2026-08-03
研究者发现,在处理 1-5 分的 Likert 量表数据时,使用 Mann-Whitney U (MWU) 检验会因数据的离散性(ties)和“四舍五入”特性而显得过于保守,从而牺牲了统计功效。
目前,针对基于秩的非参数检验的预测推断(PPI)校正方法尚未有人实现。由于这类检验不像 t 检验那样假设数据呈正态分布,其在节省人工标注成本与提升检验功效方面的收益存在局限。相比之下,Wilcoxon 符号秩检验则没有上述的 MWU 缺陷。
「研究」频道最新
- 实验展示智能体利用坐标线索学习绘制基础图形 — johnowhitaker · 2026-08-03
- NeurIPS 2026研讨会征稿:聚焦LLM社会推理与模拟 — timrudner · 2026-08-03
- 突破单一模型瓶颈:RoboHarness异构策略编排提升机器人长时序任务 — 机器之心 · 2026-08-03
- AI 训练翻车:本想生成月牙,却跑偏成了香蕉 — johnowhitaker · 2026-08-03
- 新研究「探索式建模」被指与经典 IMLE 方法高度相似 — dilipkay · 2026-08-03
- 微软研究员盘点 ICML 多项训练优化前沿研究 — JohnCLangford · 2026-08-03