实测AI自主写论文:6天烧千美元,工程满分但研究零分
RexDouglass · x · 2026-08-01
关于「AI agent 能否自主进行开放式科学研究」的实证论文出炉。研究者设计了一种「影子评估」方法:让前沿 AI agent 接手两篇高质量的未发表 NeurIPS 2026 论文的核心开放式问题,并为 agent 提供了 6 天时间和数千美元的算力。
结果显示,agent 能够在无人类帮助的情况下完成所有工程实现,但在回答核心研究问题上几乎没有实质性进展,最终被原作者明确「拒稿」。
论文总结了 agent 的五大失败模式:对可发表研究的门槛判断不佳、缺乏创造力、过度依赖已知方法、无法有效调试复杂问题以及缺乏对实验结果的深刻洞察力。
所属事件:影子评估实测:AI智能体开放式科研遭原作者全盘否决(11 条相关)→
「漫话AGI」频道最新
- AI 治理专家呼吁:摒弃过时监管模式,构建新型治理工具 — dhadfieldmenell · 2026-08-01
- 智能成本趋近于零时,世界会发生什么? — soham_btw · 2026-08-01
- RLHF 数据成 AI 经济闭环核心,高质量数据设计决定模型生死 — herbiebradley · 2026-08-01
- AI 时代技能加速折旧,传统人力资本培训模式失效 — soumitrashukla9 · 2026-08-01
- 黄仁勋反驳GPU堪比核弹论:应让所有人拥有AI — rohanpaul_ai · 2026-08-01
- KOL称若无开源模型,闭源AI月费恐高达2000美元 — iamaliveix · 2026-08-01