FrontierChallenge: Evaluating Scientific Workflow Completion
Liangcai Su, Zhaopeng Feng, Zhuo Chen, Zhen Zhang, Xiang Lin, Ruilin Li, Handuo Zhang, Ning Wang, Kailong Wen, Yueqi Guo, Feng Xing, Yiling Guo, Chenxiong Qian, Simon Shaolei Du, Lidong Bing, Xinyu Wang
cs.AI, cs.CL, cs.SE
2026-08-26
Apodex公开97道跨领域科研工作流。最好配置只完整通过20题(20.6%),分析化学最高4%、电化学0%;未通过轨迹里75.5%仍以完成口吻收尾。
现有评测多看最终答案、单段程序或单一学科。科研交付要的是一整包互相一致的产物:可跑的分析代码、对得上的表和图、按合同写的报告。中间做对了大半,缺一张图或一个数值对不上,对下游研究员来说等于没交。
FrontierChallenge把问题收窄成:目标、输入、交付物都已写死之后,Agent能不能独立把工作流跑完。它不要求立项或提问题,只考指定工作流的可靠执行。
团队攒了300条跨领域工作流,本轮公开并评97条(Hard 74、Medium 23),其余203条留下作内部集。领域切成量子化学、分子动力学、材料表征、分析化学、生命科学、电化学/环境六块,覆盖21类流程,会用到ORCA、CP2K、LAMMPS、AmberTools、PLUMED这类领域软件。
每道题是一个自包含包:固定输入、可用工具、交付合同、逐步评分细则,外加可执行Grader。主指标Pass Rate只认总分≥99.9的全合同通过;Avg. Score只描述部分进度。语义标准交给GPT-5.6 Sol当Judge,每条跑三次取平均。评了12个前沿模型,脚手架是Codex、Claude Code、Frontier Agent三种。
完整通过仍然稀有。Pass Rate从3.1%到20.6%,Avg. Score从67.5到87.9。并列最高通过率20.6%(97题里20题)来自Codex+GPT-5.6 Sol(Avg. 87.9)和Claude Code+Grok 4.6(Avg. 86.6)。八个配置Avg.超过80,没有一个能把超过五分之一的题交齐。
| 配置 | 总通过率 | Medium | Hard |
| GPT-5.6 Sol + Codex | 20.6% | 39.1% | 14.9% |
| Grok 4.6 + Claude Code | 20.6% | 43.5% | 13.5% |
| GLM-5.2 + Claude Code | 3.1% | 4.3% | 2.7% |
领域落差更大。量子化学最高60%(Grok 4.6),分子动力学最高38%。材料表征Avg.可到88.1,通过率不超过9%。分析化学Avg. 87.6,只有DeepSeek V4 Pro-0813交过题,通过率4%。电化学/环境Avg.最高94.9,通过率全员0%。
970条Claude Code轨迹里,849条未通过中有75.5%收尾仍是完成口吻。工具报错在通过轨迹里更常见(94.2%对80.7%),不能当失败判据。单题平均耗时21.8到112.8分钟;Grok 4.6每题约218万输入token,Apodex 1.1配Claude Code约1373万。附录里的典型题包括划痕愈合图像统计、倾斜TLC板定量、反应量热安全评估,交付物都是脚本加表加图加报告,少一样就不算过。
对想把Agent接进实验室流水线的人,这篇给了一个冷数字:高分、自信结项、中途报错都不可靠。缺的是合同跟踪和跨产物校验,不是再堆一轮平均分。
量子化学、分子动力学相对能交卷,分析化学和电化学几乎交不齐。聚合排行会掩盖学科短板。
结果只覆盖97道无需GPU官方评测的题,单次运行,轨迹分析只覆盖Claude Code。Token口径随厂商tokenizer和缓存规则走,不能直接比效率。领域切片不是学科难度抽样。Pass阈值99.9是为了吸收Judge三次平均的数值抖动,真正卡住人的是异质交付合同本身。