AI智能体做开放式科研被原作者全盘否决
一项最新预印本研究引入了名为“影子评估”的测试框架,探索前沿 AI 智能体能否胜任开放式的 AI 研发工作。研究者让智能体接手两篇高质量未发表论文的核心开放性问题,并为其提供 6 天时间以及数千美元的 API 额度和算力。最终,原论文作者在审查 AI 生成的论文后,明确拒绝了这些产出。
已确认
- 研究团队提出并使用了“影子评估”测试框架,让 AI 智能体针对两篇未发表的 NeurIPS 2026 提交论文的研究问题进行自主探索。
- 实验为智能体提供了 6 天时间以及数千美元的算力与 API 额度,期间智能体运行了数百次实验。
- 原论文作者对 AI 生成的论文进行了评审,并将其全盘否决。
- 智能体在结果容易验证的工程代码任务上表现尚可,但在开放式研究中表现挣扎。
- 研究总结了智能体在开放式研究中存在的五种反复出现的失败模式。
尚未确认
- 作者指出目前的负面结果属于初步结论,后续仍存在样本量限制以及脚手架改进的空间。
为什么重要
- 该研究直接触及当前 AI 发展的核心痛点,即大模型在处理目标不明确、需要深度创新的开放式科研任务时仍面临巨大瓶颈。这为盲目乐观的“AI 自动科研”叙事提供了重要的降温依据,并为评估 AI 智能体的真实科研能力提供了一个极具参考价值的基准框架。
2026-07-30 ~ 2026-07-31 · 7 条相关
一手来源
- 智能体难以胜任开放式 AI 研究:新预印本揭示五大失败模式 — random_walker ·
- 实测AI做科研:烧钱跑数百实验,结果被原作者全盘否决 — sayashk ·
- 实测前沿 AI 智能体:能搞定工程代码,但做不了开放式科研 — Peter Kirgis ·
- 【源头】实测前沿 AI 智能体:能搞定工程代码,但做不了开放式科研 — Peter Kirgis · 2026-07-30
- 【源头】实测AI做科研:烧钱跑数百实验,结果被原作者全盘否决 — sayashk · 2026-07-31
- 【源头】智能体难以胜任开放式 AI 研究:新预印本揭示五大失败模式 — random_walker · 2026-07-31
- 实测前沿AI智能体:开放式研究全被拒,能力仍存瓶颈 — sayashk · 2026-07-31