研究称评测配置差异导致模型排名剧烈波动
dair_ai · x · 2026-08-26
一项关于“Harness 评估”的研究探讨了评测配置的问题。12 个开源权重模型在 ARC、HellaSwag、MMLU 和 TruthfulQA 共 3679 个项目上,在 26 种不同配置下进行测试。结果显示,仅改变选项顺序、提示词措辞或答案读取方式,gemma4-31b 的得分范围可在 31% 到 89% 之间波动。研究指出,模型间的分数差距 95.7% 来自于配置脆弱的条目,且 12 个模型中有 4 个在某种配置下能排名第一。压缩基准(Benchmark Compression)方法倾向于选择那些对配置最敏感的条目。
「研究」频道最新
- TMLR 论文:随机最大原理推导伴随匹配算法 — rishabh16_ · 2026-08-26
- CIDER 数据集:提升个性化隐私对齐 — tianshi_li · 2026-08-26
- AI 分析胸部 CT 发现:胸腺健康程度影响肺癌患者生存率 — EricTopol · 2026-08-26
- 数学社区发布 Palomar:AI 时代的形式化数学公共档案 — repligate · 2026-08-26
- 创意基准测试展示:如何用怪诞想法评估模型 — mariofilhoml · 2026-08-26
- Rasyn Lab 发布 350M 参数逆合成模型 Synthon — ycombinator · 2026-08-26