研究发现多个科学类 LLM 基准答案有错,修正后模型分数显著上升
Profanion · reddit · 2026-09-16
Reddit 用户发现当前许多以科学为主题的 LLM 基准测试中,标准答案本身就存在错误。对这些问题答案进行修正后,各模型的基准得分显著提升。作者附上了 arXiv 论文链接(arXiv:2609.13009)。
这一发现意味着此前多个模型在科学基准上的排名可能低估了真实能力,基准数据质量本身是评测体系中被忽视的变量。对依赖榜单做模型选型的人来说,需要警惕『分数低』未必等于模型差,也可能只是评测集答案有误。
「模型」频道最新
- Claude Code 开发会话账单惊人,作者提醒:1M 上下文窗口很烧钱 — peterjliu · 2026-09-16
- 作者称 Claude 性格趋同于 Anthropic 员工文化,令人担忧 — ryunuck · 2026-09-16
- ChatGPT 联合创始人新公司:号称快 200 倍,输出 token 永久免费 — Polymarket · 2026-09-16
- GPT-6 自主修好《辐射3》著名 NPC 对话卡死 bug — imjustnewatai · 2026-09-16
- 百万上下文窗口虽香,账单能把人「烧伤」 — peterjliu · 2026-09-16
- 曝开源权重模型疑似大量蒸馏 OpenAI 与 Anthropic,训练代码缺失是佐证 — dan_s_becker · 2026-09-16