实测 AI 智能体做科研:烧钱跑六天,原论文作者全盘否定

sayashk · x · 2026-07-31

当前对 AI 智能体的评测多局限于狭窄、易验证的任务,但真实的科学研究往往是开放式的。研究人员进行了一项“影子评测”:给 AI 智能体提供两篇未发表论文的研究问题,并配以六天时间以及价值数千美元的 API 额度和算力。

结果显示,智能体在工程任务上表现得相当熟练,但在提出假设、决定合适证据以及识别失败路径等核心科研环节上表现不佳。最终,原作者对 AI 生成的论文进行了严格评审,并给出了明确的否定评价。

所属事件:实测AI做开放式科研:烧钱耗时遭原作者全盘否决(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →