研究发现多个科学类 LLM 基准答案有错,修正后模型分数显著上升

Profanion · reddit · 2026-09-16

Reddit 用户发现当前许多以科学为主题的 LLM 基准测试中,标准答案本身就存在错误。对这些问题答案进行修正后,各模型的基准得分显著提升。作者附上了 arXiv 论文链接(arXiv:2609.13009)。

这一发现意味着此前多个模型在科学基准上的排名可能低估了真实能力,基准数据质量本身是评测体系中被忽视的变量。对依赖榜单做模型选型的人来说,需要警惕『分数低』未必等于模型差,也可能只是评测集答案有误。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →