实测前沿 AI 智能体:能搞定工程代码,但做不了开放式科研
Peter Kirgis · hf · 2026-07-30
当前 AI 智能体能否胜任开放式的 AI 研究?本文提出了一种名为“影子评估(Shadow Evaluations)”的测试框架来寻找答案。
研究者让前沿 AI 智能体接手两篇高质量未发表论文的核心开放性问题,并为它们提供 6 天时间以及数千美元的算力。实验结果表明,智能体能够在无人类干预下完成所有工程代码编写,但在实质性解答研究问题方面未能取得突破,最终被原作者明确“拒稿”。
研究总结了智能体在科研中的 5 种典型失败模式:
- 对可发表研究的门槛缺乏判断力
- 面对研究设计缺陷时缺乏创造力
- 难以从死胡同中有效回溯
- 资源(算力/时间)感知能力差
- 指令漂移(偏离核心目标)
结论是:目前的智能体已能胜任 AI 研究中的“工程”部分,但在科研生命周期的关键环节仍力不从心。
「编程与Agent」频道最新
- 仅靠提示词,开发者用 Opus 零代码生成 3D 赛博朋克网页 — Dull_Film_2675 · 2026-07-30
- 给AI编程助手加戏:将工具调用变成拨号上网音效 — enjalot · 2026-07-30
- 开源自主无人机 Langostino:结合 ROS2 与强化学习 — tom_doerr · 2026-07-30
- 开发者吐槽:多智能体协作的尽头是陷入权限地狱 — edgarpavlovsky · 2026-07-30
- 开源实战:几分钟训练超向量编码器,实现 XOR 查询 — CShorten30 · 2026-07-30
- 腾讯混元AI智能体破解50年数学难题 — teortaxesTex · 2026-07-30