实测AI自主写论文:6天烧千美元,工程满分但研究零分

RexDouglass · x · 2026-08-01

关于「AI agent 能否自主进行开放式科学研究」的实证论文出炉。研究者设计了一种「影子评估」方法:让前沿 AI agent 接手两篇高质量的未发表 NeurIPS 2026 论文的核心开放式问题,并为 agent 提供了 6 天时间和数千美元的算力。

结果显示,agent 能够在无人类帮助的情况下完成所有工程实现,但在回答核心研究问题上几乎没有实质性进展,最终被原作者明确「拒稿」。

论文总结了 agent 的五大失败模式:对可发表研究的门槛判断不佳、缺乏创造力、过度依赖已知方法、无法有效调试复杂问题以及缺乏对实验结果的深刻洞察力。

所属事件:影子评估实测:AI智能体开放式科研遭原作者全盘否决(11 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →