LLM排行榜被评测配置操控:同一模型得分31%到89%
rohanpaul_ai · x · 2026-09-01
一项研究揭示LLM排行榜结果受评测配置影响巨大。论文固定模型和3679道题,仅改变提示格式、选项顺序、评分方法等常规选择,结果差异显著:gemma4-31b得分在31%到89%之间波动,12个模型中有4个在至少一种配置下排名第一。相邻模型平均差距的95.7%来自配置敏感题目。最大不稳定源是评分方式:生成答案与选择最高概率选项。
「模型」频道最新
- 关注具体场景而非最强模型,选型逻辑正在变化 — aftahi_ai · 2026-09-01
- 用户吐槽 GPT-5.6 代码与幻觉问题,寄望 GPT-6 改善 — Prestigiouspite · 2026-09-01
- Z.ai 推出 GLM-5.3-Flash:320B 参数、支持百万上下文与 NVFP4 量化 — alejandroll10 · 2026-09-01
- 传 GPT-6 已近人类计算机操控水平 — jYtanYj · 2026-09-01
- 开源模型转向非商用许可,后训练授权或成千亿市场 — zephyr_z9 · 2026-09-01
- Hailuo H3 Max 速度够快,用户用它做出了可交互 AI 开放世界 RPG — mtizard · 2026-09-01