计算化学智能体两年从4个涨到近50个,能公开试用的只剩4个

Science Done on a Machine by a Machine: AI Agents in Computational Chemistry

Pavlo O. Dral, Hassan Nawaz, Arif Ullah

physics.chem-ph, cs.AI, physics.comp-ph

2026-08-19

厦门大学等盘点截至2026-08-08的49个计算化学智能体:2024年4个,2026年前8个月33个。任务覆盖结构生成与分子动力学,反应机理很少;多数系统只有开发者自己在用。

这篇在解决什么

计算化学里单次计算早就能脚本化,人的时间并没有被脚本省下来,只是挪到了选题、写输入、盯失败、改计划、读结果。GPT-4之后,专门给原子尺度模拟搭智能体成了一门赛道。厦门大学Dral组、安徽大学和Aitomistic把截至2026年8月8日、对象是分子/材料/催化表面上的量子化学、分子动力学或机器学习势计算的系统收成一份Perspective:49个。问题不是再报一个新agent,而是这波爆炸已经快到「专门系统」本身可能站不住。

方法

这是综述加立场,不是新方法论文。纳入标准卡在「AI来搭、跑、解释一次原子尺度计算」。按首次公开时间画累计曲线,再按任务类型、编排框架、自主粒度、许可证和能否免安装试用做交叉统计。自主粒度从单次计算、一次in silico实验、写到论文,再到无人监督的课题战役和自己定议程。作者自己的Aitomia和后续Protomia标在图里,文中也写了教学与组内使用的体感,需要当成当事人观察,不是第三方盲测。

结果

公开数量:2024年4个(约0.3个/月),2025年12个(1.0个/月),2026年到8月8日33个(4.6个/月)。任务侧,结构生成33、分子动力学27、电子结构15、周期DFT 15、振动14、自由能12、筛选9、过渡态9、激发态8、机器学习势开发6。自由能里8个走谐振加理想气体的静态路径,4个才采样系综。过渡态和反应屏障仍薄,作者认为这本来就是计算化学最难的一块。

自主粒度:单次计算21、实验尺度24、论文尺度4、战役0、议程0。文中明确,所有已报道系统都还把人留在环内。编排上早期常见LangGraph(9)和LangChain(6),12个系统写自己的循环;2026年出现绑Claude Code、Codex、OpenClaw这类通用编码agent。新系统叠代码生成、MCP和skills,预定义工具并没有消失,只是不再是唯一接口。

可复用性更难看。49个里27个写了许可证,22个找不到,其中6个公开仓库连许可证文件都没有。多数没有测试和CI,有的缺模块、入口被注释、路径写死在作者机器上。免安装能试的只有4个:TritonDFT、VASPilot、AutoSolvateWeb,以及托管服务Protomia。Aitomia低自主单任务成功率99.6%,自主升高后掉到70.9%和45.6%,且基于已过时的LangGraph架构;Protomia声称实验和论文级能力,正式评测还没发。

为什么重要

对做AI4Science工具的人,这篇的判断很冷:专门计算化学agent正在被通用编码agent和skills/MCP commoditize。系统数量爆炸、组外采用极低,两边同时成立,说明瓶颈已经从「能不能算」转到「谁愿意换工作流」。单次计算已经相当稳,实验级在成为主流,论文级仍要大量人工把关。如果只是想跑标准流程,先问现有编码agent能不能调你的skills,再决定要不要再造一个带Logo的编排层。

局限与存疑

截至于2026-08-08,公开报告落后于前沿实验室内部。任务标签来自论文自述,不是统一基准上的盲测,系统之间不能直接比谁更强。评测依赖人工、贵token、还容易污染,作者也承认几乎无法把49个放在同一起跑线。Aitomia数字和Protomia能力来自本实验室,采用慢、组员仍把脚本贴进网页聊天框,是轶事。文末「人人都在给自己掘墓」是立场,不是可证伪的实验结论。手稿本身也披露由实验室的AI研究agent辅助起草,终稿由Dral执笔。

术语

原文与代码

社区讨论

相关论文

全部论文解读