4608次测试仅3.3%无需人工干预,中科大实测AI科学家

新智元 · wechat · 2026-07-31

中国科学技术大学发布最新研究,搭建了包含45个模块化工作站的机器催化实验室,让 AI 智能体通过机器可读技能直接调用实验设备,测试其能否在真实物理世界中进行端到端的科学发现。

研究团队对6种智能体框架和9种大语言模型构成的48种配置进行了4,608次压力测试。结果显示,当前领先的 AI 智能体距离「接管」实验室仍有明显差距:仅有 3.3%(151个)的工作流无需人工修复即可直接执行。表现最好的 Claude Code 与 Claude 3.5 Sonnet 组合可执行率为 28.1%。

进一步的闭环测试表明,智能体虽能根据实验反馈调整局部参数(如材料配方),但无法在科学层面重新规划研究策略或纠正关键遗漏。长程规划依然是核心瓶颈,极少有工作流能维持超过30个操作步骤的逻辑完整性。该研究清晰区分了「生成实验计划」、「物理可执行工作流」与「调整整体研究策略」三种截然不同的能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →