EurekaBench:GPT-6 Astra 预测近乎比肩人类,科学洞见仅 29.4%
geoffwolfe · x · 2026-10-04
ReasonCore 发布新基准 EurekaBench,检验 AI 实验能否发现解释观察结果的科学机制,与 SciCode(测科学代码)、CritPt(测研究级物理题)互补。基准覆盖 6 个领域、26 个问题、306 个洞见问题,分别评测科学约束、预测准确性与机制洞见。
结果颇有反差:GPT-6 Astra 在预测上几乎追平人类参考水平(47.4% vs 48.8%),但在科学洞见上大幅落后(29.4% vs 69.7%)——拟合数据不等于理解机制。ReasonCore 正在围绕该基准构建数据集。
所属事件:EurekaBench 发布:AI 解题强但科学洞见仅约三成(2 条相关)→
「研究」频道最新
- 神经科学实证:生物神经网络的突触可塑性近似反向传播 — aran_nayebi · 2026-10-04
- 单条 prompt 让 AI 五分钟内自动发现并验证连续介质力学新模型 — CatAstro_Piyush · 2026-10-04
- 指数族的 KL 散度等价于 Bregman 散度的理论笔记 — FrnkNlsn · 2026-10-04
- NeuroAgent 通过斑马鱼全脑图灵测试,覆盖约 13 万神经元 — aran_nayebi · 2026-10-04
- UTDallas 智能机器人实验室转向:从感知研究押注可泛化的机器人操作学习 — YuXiang_IRVL · 2026-10-04
- generativist 重读 Chris Olah 信息论长文:看清「可解释性鸿沟」 — generativist · 2026-10-04