ASI-Bench: At the Dawn of Artificial Superintelligence
Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie
cs.AI
2026-08-18
清华牵头、40 余名专家花 3.1 万小时构建的 ASI-Bench 用 60 个项目级科研任务在四级指导梯度下测 18 个 Agent 组合:撤掉完整方法步骤一项就让平均分掉 21.8 分,而完全不给方法只再掉 2.5 分。
现有基准测的是两种东西:有已知答案的知识题(HLE、GPQA),或者人已把目标和方法规定好的执行题(Terminal-Bench、MLE-Bench、PaperBench)。它们都回答不了「AI 能不能自己把一项科研项目从头做到尾」这个问题,因为方法路径是人类给的。
这篇的测法很直接:同一个科研任务,保持研究目标、数据、产出要求和评分标准不变,把给 AI 的方法学信息逐级撤走,看分数怎么掉。掉得越狠,说明系统对人类指导的依赖越深。
ASI-Bench 由清华牵头、MIT、哈佛等 13 个机构的 40 余名研究者构建,投入超 3.1 万人工小时。从 1300 多个候选研究想法出发,经 5 轮评审、1100 多次评审分配、1500 多次沙箱运行,最后留下 60 个项目级任务,覆盖数学、物理、化学、生物、天文、材料、地学、医学、计算机、机器人、电子工程 11 个领域。每个任务包含科学目标、数据、可执行环境和可验证的研究产出,做完的是整个研究流程而非单题问答:理解问题、选方法、实现、实验、失败诊断、迭代、验证。全部任务合计涉及 2600 多轮交互、2400 多个执行步骤、35 小时以上的 agent 执行。
指导梯度分四级,以一个二维非线性动力系统任务为例:B1 给全 Governing PDE、数值格式和求解步骤;B2 只说这是哪类 PDE、该用哪类数值方法;B3 只给时空观测数据和科学目标,方法完全自己定;B4 在 B3 基础上加看似合理但与任务无关的信息,测抗干扰。
这个设计把「按流程执行」「把指定方法落成工作流」「独立做研究」拆成三件可分别测量的事。
18 个 Agent×Model 组合(6 个 harness × 14 个模型,含 Codex、Claude Code、Kimi Code、OpenHands 等)在三轮独立运行下取宏平均:
| 设置 | 平均分 | 相邻级差 |
| B1(完整方法+步骤) | 50.91 | -21.82 |
| B2(只给方法名) | 29.10 | -2.48 |
| B3(方法自己定) | 26.62 | +0.36 |
| B4(B3+干扰信息) | 26.99 | - |
两个结构性发现比总分重要。
第一,瓶颈不在选方法,在把方法变成完整流程。B1 到 B2 掉 21.82 分,B2 到 B3 只掉 2.48 分:告诉它「该用谱方法」几乎不帮忙,把谱方法展开成数值格式和求解步骤才值 21 分。B4 与 B3 几乎持平,干扰信息不是问题。论文把这命名为 method operationalization 瓶颈。
第二,同一个模型换个 harness 表现差很多。MiMo V2.5 Pro 从 MiMo Code 的 16.17 分换到 Claude Code 涨到 23.25,Kimi K2.7 从 19.72 涨到 27.34;但 Kimi K3 在两个 harness 下只差 0.87 分。科研能力不由基座模型单独决定,而是模型与 harness 的交互产物。
成本侧:最强配置 Codex + GPT-5.6 Ultra 在 B3 拿 51.60 分,是唯一过 50 的系统,单次运行约 1550 美元;GPT-5.6 xhigh 约 684 美元拿到 40.86,与 2728 美元的 Claude Opus 5 + Claude Code(40.70)持平,花四分之一的钱买到同级表现。推理努力从 xhigh 提到 ultra,B3 从 40.86 涨到 51.60。有趣的是 B2 最烧钱:每任务平均 6.91M token、49.7 分钟,比 B1 多 59% token、32% 时间,方向被限定又得自己补流程细节,比完全自由探索更折腾。
对做 agent 的工程师,这项测试指明了改进方向:提升自主科研能力的杠杆在「方法落地成可执行研究流程」这一环,不在方法选择或抗干扰。对评估,它证明报一个笼统的「科研能力分」没有意义,B1 到 B3 的梯度才是有效信号;比较模型时必须连 harness 一起报,否则归因就是错的。基线已经开源,任务贡献通道开放,后续版本会持续扩充。
论文承认 60 个任务只是起点,覆盖面有限。更结构性的问题:评审、出题、参考答案全由构建团队完成,18 个组合里中国团队模型占比高,任务来源与评审视角可能存在系统性偏向。「得分」是加权评分器的输出,与研究质量的真实关系依赖评分器设计,论文没有给出与人类专家判断的对齐验证。头部配置的标准差不小(Codex + GPT-5.6 Ultra 的 B3 标准差 ±3.65),50 分段的排名差距需要谨慎解读。另外全部评测在无外部工具访问的沙箱中进行,真实科研环境里检索文献、查数据库会改变 B2/B3 的相对难度。