Wilcoxon 检验显得保守,只是这组测试数据的假象
IanArawjo · x · 2026-07-24
作者说明,图里看起来 Wilcoxon signed-ranks 很“保守”,并不是这个检验方法天然如此,而是 这组测试数据的 judge 分数分布 造成的假象。
这项分析目前用了三个数据集:WMT 翻译质量、Chatbot Arena、App Store 评论;以及四个 judge 模型:Inkling、Claude Haiku 4.5、Gemma 3(26B)、GPT-OSS-20b。作者还说后面要补上 omnibus tests,但现在这张图已经足够说明当前结论的边界。
所属事件:用PPI校正统计检验消除LLM评测假阳性(5 条相关)→
「研究」频道最新
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11