新论文泼冷水:答对难题不等于做科学,刷榜成干扰
ShenRaphael · x · 2026-08-19
论文作者(@chenruduan)提出不受欢迎的观点:基准榜单竞赛正成为科学研究的干扰——每隔几个月出现更难的考试,模型又很快刷满,但 AI 并非每周都在做出发现。
其论点是:回答难题 ≠ 做科学。科学发现关乎不确定性下的推理与决策:假说要经受现实检验、实验会失败、噪声数据要求克制校准。论文主张按完整的「发现回合」(状态→行动→观察→更新状态,类似 RL 循环)来评估 AI 科学家——给轨迹打分而非只看答案,保留失败记录。
「漫话AGI」频道最新
- Waymo 数据佐证安全优势,AI 医疗采纳或复刻自动驾驶曲线 — Scobleizer · 2026-08-19
- AI 并非单一产品周期:万亿投入背后的资本支出逻辑 — Scobleizer · 2026-08-19
- 观点:AI 对齐领域缺少气候圈那样的中间层影响者 — AndyMasley · 2026-08-19
- 观点:称自己为设计工程师已变得几乎多余 — eschadiol · 2026-08-19
- Robotaxi 将拯救生命并大幅改善社会效率 — jamesdouma · 2026-08-19
- 设计师吐槽:复制和发布太容易,设计过时速度变得可笑 — eschadiol · 2026-08-19