前沿Agent测评:能搞定工程但搞不定科研
burny_tech · x · 2026-08-17
研究发现
- 测试方法:让 Agent 接手 NeurIPS 2026 两篇未发表论文的核心研究问题,由原作者评分。
- 资源投入:给予前沿 Agent 6 天时间和数千美元算力。
- 核心结论:Agent 在无人协助下完成了所有工程任务,但在回答研究问题上几乎毫无进展,两篇论文均被明确拒稿。
失败模式
- 对可发表研究的门槛判断差
- 对研究设计缺陷的反应缺乏创意
- 未能有效从死胡同回溯
- 资源意识薄弱
- 指令执行过程中发生漂移
「编程与Agent」频道最新
- GPT-5.6 Sol 新增无需开新线程的 Agent 委托能力 — JeremyNguyenPhD · 2026-08-17
- 在Grok Bot上运行Hermes Agent:跨模型对抗审查 — Teknium · 2026-08-17
- 开发者吐槽 OpenAI Sol 模型速率限制 — iamrobotbear · 2026-08-17
- 用 Apps Script 自动化贴标,开发者咨询合理定价 — Responsible-Box-4905 · 2026-08-17
- 曝大厂AI电影制作全流程:Seedance 2.5+Higgsfield打造百万美元影片 — EXM7777 · 2026-08-17
- Teknium 计划更新 Hermes 以支持 GPT-5.6 — Teknium · 2026-08-17