ChemBench:最强模型化学成绩超顶尖化学家,却仍会翻车且过度自信
geoffwolfe · x · 2026-09-22
ChemBench 研究发现:模型化学能力呈「锯齿状」
- Nature Chemistry 发表的 ChemBench 基准包含 2700 多道化学问答题,用于对比大模型与职业化学家的知识与推理能力。
- 核心结论:最强模型的平均成绩已超过参与测试的最优秀化学家,但仍在基础任务上失败,且经常做出过度自信的错误预测。
- 研究者强调:这种「高均值 + 危险盲区」的锯齿状能力分布,意味着单一领域平均分不足以评估模型在该领域的可靠性。
- 转发方 ReasonCoreAI 借此推广自家库存中的 ChemBench 风格评估任务(带有自我营销成分)。
「研究」频道最新
- 用可验证奖励加评分细则改造模型训练的评分算力 — stochasticchasm · 2026-09-22
- 「数学没有被解决」:AI 是把数学生走遍的宇宙变成虫洞 — ignite_intelligence · 2026-09-22
- JevBench v1.3.0 发布:原版 Jev 以 74.4 分仍居首,47 个竞品逼近 — airesearch12 · 2026-09-22
- PufferLib 作者对比:1 秒 1 GPU 训完 Breakout 的 RL 配置 — jsuarez · 2026-09-22
- DeepSeek 对阵 Jev:无文本「系统一」模型基准的新对照 — frappuccinoCoin · 2026-09-22
- 把前端设计归入视觉 agent 任务,分组相对评分缓解 reward hacking — stochasticchasm · 2026-09-22