清华发布 ASI-Bench:60道题测AI能否自主科研
机器之心 · wechat · 2026-08-26
清华大学陈勇超团队联合 MIT、哈佛等十余所机构发布 ASI-Bench,这是一个专为衡量 AI 科学自主性设计的基准测试。不同于现有的考试题或执行任务,ASI-Bench 通过“信息梯度”机制,在同一个科研项目中逐步减少给模型的方法指导(从完整步骤到仅给目标),测试通用智能、创新性和自主执行力。
核心发现:测试了 18 组 Model + Agent 组合后,当提供完整方法(B1)时平均得分为 50.92;一旦撤去详细指导(B3),分数骤降至 27.17。即使是最强的 Codex + GPT-5.6Sol 组合,分数也从 71.78 跌至 51.60。62% 的失败集中在科学决策环节,证明当前 AI 的瓶颈在于不知道“该算什么”和“怎么设计路径”,而非数值计算错误。
所属事件:清华联合多机构发布 ASI-Bench 基准测 AI 科研能力(3 条相关)→
「研究」频道最新
- arXiv 数学投稿量暴涨 33.5%,论文指 AI 正重塑理论研究生产 — rohanpaul_ai · 2026-09-23
- 2026 年 arXiv 数学提交量激增 33.5%,30 个子领域 29 个增长 — rohanpaul_ai · 2026-09-23
- Mixture-of-Depths:让Transformer按token动态分配算力 — burny_tech · 2026-09-23
- Theorem 创始人:AI 已攻克形式验证最难的一环 — burny_tech · 2026-09-23
- 科研数据挖掘框架 Minerva 预印本已发布 — BrianHie · 2026-09-23
- 基因组语言模型 Minerva 发现新型逆转录酶机制 — BrianHie · 2026-09-23