Wilcoxon 检验显得保守,只是这组测试数据的假象

IanArawjo · x · 2026-07-24

作者说明,图里看起来 Wilcoxon signed-ranks 很“保守”,并不是这个检验方法天然如此,而是 这组测试数据的 judge 分数分布 造成的假象。

这项分析目前用了三个数据集:WMT 翻译质量、Chatbot Arena、App Store 评论;以及四个 judge 模型:Inkling、Claude Haiku 4.5、Gemma 3(26B)、GPT-OSS-20b。作者还说后面要补上 omnibus tests,但现在这张图已经足够说明当前结论的边界。

所属事件:用PPI校正统计检验消除LLM评测假阳性(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →