实测前沿 AI 智能体做开放式研究:6天烧3000刀全折戟

gerardsans · x · 2026-08-02

一项最新研究测试了前沿 AI 智能体能否胜任开放式 AI 研究。测试为智能体提供了 6 天时间、3000 美元预算、完整的虚拟沙箱和网络访问权限,并让它们尝试解决两篇未发表的 NeurIPS 2026 论文中的核心问题。

结果表明,尽管智能体在零人工干预下完成了完整的执行循环,并处理了许多工程任务,但未能实现核心研究目标,递归自我改进(RSI)也未能发生。原论文作者作为专家审稿人给出了 1/6 和 2/6 的低分并拒绝了这些生成的论文。研究总结了五种常见的失败模式,其中最突出的是判断力差(例如误判任务难度)。

所属事件:实测AI智能体自主科研:6天花3000美元论文全被拒(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →