ScienceArena 基准:模型做化学题遇结构图,得分掉近 10 个点
geoffwolfe · x · 2026-09-27
Qiyuan Tech 与北大、清华等团队合作发布 ScienceArena,一个基于最新科学奥赛(13 个竞赛年度数据集)评测 LLM 科学推理的基准,旨在应对基准饱和与数据污染问题。
核心发现:
- 需要分子结构图的化学题,模型平均只得 64.5% 的分,而无结构图题可达 74.1%,差距近 10 个百分点
- 说明模型能写出流畅的反应「故事」,但在必须锁定具体分子结构时表现明显下滑
- 作者主张评测应考察模型对结构的真实承诺,而非流利的科学散文
对化学等需要精确结构输出的科学推理任务,当前 LLM 仍有系统性短板。
「模型」频道最新
- Yacine 直言仍受不了 Opus 5.5 的文风 — yacineMTB · 2026-09-27
- GPT-6 Astra 对阵 Opus 5.5,两大模型同玩《Unciv》对战 — Angaisb_ · 2026-09-27
- Google 各产品更新停滞:nano banana 六月后无升级引担忧 — haider1 · 2026-09-27
- 爆料:Anthropic 合作方已拿到 Sonnet 5 新检查点,或下周发布 — kimmonismus · 2026-09-27
- Codex 突发硬重置额度遭用户抗议:剩 60% 用量被清零 — ChrisUniverse · 2026-09-27
- 前 NVIDIA 员工:美国忽视海外用户,全球转向中国模型 — ivan_bezdomny · 2026-09-27