实测AI做科研:烧钱跑数百实验,结果被原作者全盘否决

sayashk · x · 2026-07-31

研究团队探索了 AI agent 能否胜任开放式的 AI 研究。他们让 agent 针对两篇未发表论文的研究问题进行探索,提供了 6 天时间以及数千美元的 API 和算力额度,并由原论文作者对 AI 生成的论文进行评审。

结果,原作者们明确拒绝了 agent 的产出。这种测试被称为“影子评估”。

尽管 agent 在工程任务上表现出色(如文献综述、调试 GPU 环境、运行数百次实验和排版 LaTeX),但在提出假设、判断证据有效性和识别失败方向等开放式科研核心能力上,依然远不及人类研究员。

所属事件:AI智能体实测做科研被原作者全盘否决(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →