实测前沿 AI 智能体:能搞定工程代码,但做不了开放式科研

Peter Kirgis · hf · 2026-07-30

当前 AI 智能体能否胜任开放式的 AI 研究?本文提出了一种名为“影子评估(Shadow Evaluations)”的测试框架来寻找答案。

研究者让前沿 AI 智能体接手两篇高质量未发表论文的核心开放性问题,并为它们提供 6 天时间以及数千美元的算力。实验结果表明,智能体能够在无人类干预下完成所有工程代码编写,但在实质性解答研究问题方面未能取得突破,最终被原作者明确“拒稿”。

研究总结了智能体在科研中的 5 种典型失败模式:

结论是:目前的智能体已能胜任 AI 研究中的“工程”部分,但在科研生命周期的关键环节仍力不从心。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →