清华发布 ASI-Bench:60道题测AI能否自主科研

机器之心 · wechat · 2026-08-26

清华大学陈勇超团队联合 MIT、哈佛等十余所机构发布 ASI-Bench,这是一个专为衡量 AI 科学自主性设计的基准测试。不同于现有的考试题或执行任务,ASI-Bench 通过“信息梯度”机制,在同一个科研项目中逐步减少给模型的方法指导(从完整步骤到仅给目标),测试通用智能、创新性和自主执行力。

核心发现:测试了 18 组 Model + Agent 组合后,当提供完整方法(B1)时平均得分为 50.92;一旦撤去详细指导(B3),分数骤降至 27.17。即使是最强的 Codex + GPT-5.6Sol 组合,分数也从 71.78 跌至 51.60。62% 的失败集中在科学决策环节,证明当前 AI 的瓶颈在于不知道“该算什么”和“怎么设计路径”,而非数值计算错误。

所属事件:清华联合多机构发布 ASI-Bench 基准测 AI 科研能力(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →