EurekaBench 发布:AI 解题强但科学洞见仅约三成
研究团队发布新基准 EurekaBench,用于检验 AI 实验能否发现解释观察结果的科学机制,与测科学代码的 SciCode、测研究级物理题的 CritPt 形成互补。测试显示,GPT-6 Astra 的预测能力近乎比肩人类,但其产出真正科学洞见的表现仅为 29.4%。结果显示 AI agent 在目标明确时极擅长优化求解,却未必能加深人类的科学理解,凸显当前 AI 科学助手的关键缺口。
2026-10-03 ~ 2026-10-04 · 2 条相关
- EurekaBench:AI agent 擅长解题,却难以产出真正科学洞见 — scott_linderman · 2026-10-03
- EurekaBench:GPT-6 Astra 预测近乎比肩人类,科学洞见仅 29.4% — geoffwolfe · 2026-10-04