实测前沿 AI 智能体做开放式研究:6天烧3000刀全折戟
gerardsans · x · 2026-08-02
一项最新研究测试了前沿 AI 智能体能否胜任开放式 AI 研究。测试为智能体提供了 6 天时间、3000 美元预算、完整的虚拟沙箱和网络访问权限,并让它们尝试解决两篇未发表的 NeurIPS 2026 论文中的核心问题。
结果表明,尽管智能体在零人工干预下完成了完整的执行循环,并处理了许多工程任务,但未能实现核心研究目标,递归自我改进(RSI)也未能发生。原论文作者作为专家审稿人给出了 1/6 和 2/6 的低分并拒绝了这些生成的论文。研究总结了五种常见的失败模式,其中最突出的是判断力差(例如误判任务难度)。
所属事件:实测AI智能体自主科研:6天花3000美元论文全被拒(2 条相关)→
「编程与Agent」频道最新
- 当代码极度廉价:AI开发的“温莎神秘屋”问题与DSPy实践 — dbreunig · 2026-08-25
- 从 GPT 妖怪问题看 Astra 的持续学习蓝本 — imjustnewatai · 2026-08-25
- 众包平台不可靠,AI 输出专家验证遇瓶颈 — anmarasovic · 2026-08-25
- 开源 RocketRide:C++ 内核的 IDE 内可视化 AI 管线引擎,7k 星 — abhishek__AI · 2026-08-25
- RocketRide:IDE 内可视化构建 AI 流水线 — abhishek__AI · 2026-08-25
- Jared Palmer:在 Agent 时代,Stylex 比 Tailwind 更优越 — Vjeux · 2026-08-25