研究称评测配置差异导致模型排名剧烈波动

dair_ai · x · 2026-08-26

一项关于“Harness 评估”的研究探讨了评测配置的问题。12 个开源权重模型在 ARC、HellaSwag、MMLU 和 TruthfulQA 共 3679 个项目上,在 26 种不同配置下进行测试。结果显示,仅改变选项顺序、提示词措辞或答案读取方式,gemma4-31b 的得分范围可在 31% 到 89% 之间波动。研究指出,模型间的分数差距 95.7% 来自于配置脆弱的条目,且 12 个模型中有 4 个在某种配置下能排名第一。压缩基准(Benchmark Compression)方法倾向于选择那些对配置最敏感的条目。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →