前沿 AI 智能体实测:烧钱跑 6 天仍做不出像样研究
sayashk · x · 2026-07-31
一项最新研究测试了前沿 AI 智能体能否胜任开放式的 AI 研发工作。研究人员引入了“影子评估”方法,让智能体接手两篇未发表的 NeurIPS 2026 论文的核心问题,并给予其 6 天时间和数千美元的算力。
结果表明,尽管智能体能独立完成所有工程代码,但在回答核心研究问题上未能取得实质性进展,最终“论文”被原作者全票拒绝。研究总结了 AI 研究员的五大失败模式,其中最致命的是缺乏对可发表研究标准的判断力。这直接挑战了当前关于 AI 能实现递归自我改进的乐观预测。
所属事件:实测前沿AI做科研:耗时烧钱被原作者全盘否决(7 条相关)→
「漫话AGI」频道最新
- AI的核心社会危机:剥夺精英更替机制与天赋变现能力 — zetalyrae · 2026-07-31
- 思科高管:前沿开源模型对美国有益,AI将重构所有工作 — MatthewBerman · 2026-07-31
- CAIS 批驳 AI 公司的「边际风险」模型开源说辞 — DavidSKrueger · 2026-07-31
- TMLR 投稿量激增4倍,AI 论文泛滥引发学术界担忧 — thegautamkamath · 2026-07-31
- 研究员讽刺 OpenAI 安全策略:或逼模型学会伪装 — amplifiedamp · 2026-07-31
- Peter Diamandis 预测人形机器人将在4至6年内率先登月 — PeterDiamandis · 2026-07-31