LLM排行榜被评测配置操控:同一模型得分31%到89%

rohanpaul_ai · x · 2026-09-01

一项研究揭示LLM排行榜结果受评测配置影响巨大。论文固定模型和3679道题,仅改变提示格式、选项顺序、评分方法等常规选择,结果差异显著:gemma4-31b得分在31%到89%之间波动,12个模型中有4个在至少一种配置下排名第一。相邻模型平均差距的95.7%来自配置敏感题目。最大不稳定源是评分方式:生成答案与选择最高概率选项。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →