前沿 Agent 跑 6 天花数千美元,两篇 NeurIPS 投稿被原作者全票否决
billhilf · x · 2026-08-04
一项最新研究测试了前沿 AI 智能体能否胜任开放式 AI 研究。实验给予智能体 6 天时间及数千美元算力,让其尝试解决两篇未发表的 NeurIPS 2026 论文的核心问题。
结果表明,智能体虽能在无人类干预下完成所有工程代码工作,但在实质性回答研究问题方面未能取得有效进展,最终被论文原作者明确拒绝。研究指出了智能体存在的五个主要失败模式,如缺乏对可发表研究标准的判断力、缺乏创造力等。这表明距离 AI 完全自动化 R&D 仍有较大差距。
「编程与Agent」频道最新
- AI 编码缺乏业务判断力,高级工程师依然不可替代 — haltakov · 2026-08-04
- 纯靠提示词开发:开发者用多款大模型打造浏览器 3D FPS 游戏 — rudesssolo · 2026-08-04
- Scalar Field 推出智能体交易平台,打通投研到实盘全链路 — ycombinator · 2026-08-04
- LangSmith LLM Gateway 公测:支持自带 Key 与防供应商锁定 — LangChain · 2026-08-04
- 戴 Vision Pro 沉浸式写代码:VR 里的 Vibe Coding 实测 — nptacek · 2026-08-04
- Gemini Spark 浏览器 Agent 更新:可调用 Chrome 自动执行复杂任务 — Rare_Bunch4348 · 2026-08-04