EurekaBench 发布:AI 解题强但科学洞见仅约三成

研究团队发布新基准 EurekaBench,用于检验 AI 实验能否发现解释观察结果的科学机制,与测科学代码的 SciCode、测研究级物理题的 CritPt 形成互补。测试显示,GPT-6 Astra 的预测能力近乎比肩人类,但其产出真正科学洞见的表现仅为 29.4%。结果显示 AI agent 在目标明确时极擅长优化求解,却未必能加深人类的科学理解,凸显当前 AI 科学助手的关键缺口。

2026-10-03 ~ 2026-10-04 · 2 条相关