Wilcoxon 检验显得保守,只是这组测试数据的假象
IanArawjo · x · 2026-07-24
作者说明,图里看起来 Wilcoxon signed-ranks 很“保守”,并不是这个检验方法天然如此,而是 这组测试数据的 judge 分数分布 造成的假象。
这项分析目前用了三个数据集:WMT 翻译质量、Chatbot Arena、App Store 评论;以及四个 judge 模型:Inkling、Claude Haiku 4.5、Gemma 3(26B)、GPT-OSS-20b。作者还说后面要补上 omnibus tests,但现在这张图已经足够说明当前结论的边界。
所属事件:用PPI校正统计检验消除LLM评测假阳性(5 条相关)→
「研究」频道最新
- ARC AGI 3 应该保持私有,不该公开示例和数据集 — flowersslop · 2026-07-27
- ExploitGym 可能只有六到七成任务可解,引发 OpenAI 作弊争议 — max_paperclips · 2026-07-27
- Chollet 认为智能可能有硬上限,AI 进步会趋于边际递减 — binarybits · 2026-07-27
- 论文提出图拓扑可成为 AI Agent 核心框架 — theomitsa · 2026-07-27
- 一个问题追问多智能体分支如何随算力和模型规模变化 — iskander · 2026-07-27
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27