EurekaBench:GPT-6 Astra 预测近乎比肩人类,科学洞见仅 29.4%

geoffwolfe · x · 2026-10-04

ReasonCore 发布新基准 EurekaBench,检验 AI 实验能否发现解释观察结果的科学机制,与 SciCode(测科学代码)、CritPt(测研究级物理题)互补。基准覆盖 6 个领域、26 个问题、306 个洞见问题,分别评测科学约束、预测准确性与机制洞见。

结果颇有反差:GPT-6 Astra 在预测上几乎追平人类参考水平(47.4% vs 48.8%),但在科学洞见上大幅落后(29.4% vs 69.7%)——拟合数据不等于理解机制。ReasonCore 正在围绕该基准构建数据集。

所属事件:EurekaBench 发布:AI 解题强但科学洞见仅约三成(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →