新论文泼冷水:答对难题不等于做科学,刷榜成干扰

ShenRaphael · x · 2026-08-19

论文作者(@chenruduan)提出不受欢迎的观点:基准榜单竞赛正成为科学研究的干扰——每隔几个月出现更难的考试,模型又很快刷满,但 AI 并非每周都在做出发现。

其论点是:回答难题 ≠ 做科学。科学发现关乎不确定性下的推理与决策:假说要经受现实检验、实验会失败、噪声数据要求克制校准。论文主张按完整的「发现回合」(状态→行动→观察→更新状态,类似 RL 循环)来评估 AI 科学家——给轨迹打分而非只看答案,保留失败记录。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →