4608次测试仅3.3%无需人工干预,中科大实测AI科学家
新智元 · wechat · 2026-07-31
中国科学技术大学发布最新研究,搭建了包含45个模块化工作站的机器催化实验室,让 AI 智能体通过机器可读技能直接调用实验设备,测试其能否在真实物理世界中进行端到端的科学发现。
研究团队对6种智能体框架和9种大语言模型构成的48种配置进行了4,608次压力测试。结果显示,当前领先的 AI 智能体距离「接管」实验室仍有明显差距:仅有 3.3%(151个)的工作流无需人工修复即可直接执行。表现最好的 Claude Code 与 Claude 3.5 Sonnet 组合可执行率为 28.1%。
进一步的闭环测试表明,智能体虽能根据实验反馈调整局部参数(如材料配方),但无法在科学层面重新规划研究策略或纠正关键遗漏。长程规划依然是核心瓶颈,极少有工作流能维持超过30个操作步骤的逻辑完整性。该研究清晰区分了「生成实验计划」、「物理可执行工作流」与「调整整体研究策略」三种截然不同的能力。
「编程与Agent」频道最新
- 破万星!支持主流AI代码助手的逆向与安全测试路由包 — zhaoxuya520 · 2026-07-31
- 国产大模型 Agent 实测:Kimi K3 与 DeepSeek V4 Pro 跑分曝光 — Teknium · 2026-07-31
- 单张 L4 跑 Qwen 抽知识图谱:韩晓开源实体抽取利器 — JeremyCMorgan · 2026-07-31
- Anthropic 工程师靠图工程跑百个 Agent,单人顶一个团队 — blaizedsouza · 2026-07-31
- 用 Claude Code 结合 MCP 连接器,从零搭建并部署网站 — TawohAwa · 2026-07-31
- 解决Agent执行中断难题:开源工具实现多步操作自动回滚 — Hour-Bite8746 · 2026-07-31