实测 AI 智能体做开放式研究:烧钱耗时却被原作者全盘否定
sayashk · x · 2026-07-31
研究人员进行了一项“影子评估”,测试 AI 智能体能否胜任开放式的 AI 研究。他们为智能体提供了两篇未发表论文的研究问题,并给予六天时间以及数千美元的 API 额度和算力。
然而,原论文作者在审查 AI 生成的论文后,明确拒绝了这些产出。研究指出,尽管智能体在大多数工程类任务上表现得相当熟练,但在需要持续探索、识别文献空白以及对原始研究问题保持敏锐度等真正的研究核心技能上依然严重缺失。此外,这也引发了担忧:当 AI 研究能力达到能发现新知识的临界点时,人类可能已经无法有效捕捉它们所犯的错误了。
所属事件:实测AI做开放式科研:烧钱耗时遭原作者全盘否决(8 条相关)→
「编程与Agent」频道最新
- Allie Miller分享AI智能体日常提示词,语音模式结合计算机使用体验惊艳 — alliekmiller · 2026-07-31
- 开源项目:tmux 会话管理器注册为 MCP 服务器,让 Agent 自主命名会话 — khalon23 · 2026-07-31
- AdaMAST:用失败分类法提升AI代理表现 — abeirami · 2026-07-31
- Circle 设 5 万美元 Agentic Economy 奖,攻坚 AI 智能体自主支付 — PeterDiamandis · 2026-07-31
- Gemini API 实用技巧:Managed Agents 自带 7 天代码沙箱 — tristanbob · 2026-07-31
- MCP 工具数量逼近上限,如何管理超 200 个工具? — Calm-Republic9370 · 2026-07-31