实测 AI 智能体做科研:烧钱跑六天,原论文作者全盘否定
sayashk · x · 2026-07-31
当前对 AI 智能体的评测多局限于狭窄、易验证的任务,但真实的科学研究往往是开放式的。研究人员进行了一项“影子评测”:给 AI 智能体提供两篇未发表论文的研究问题,并配以六天时间以及价值数千美元的 API 额度和算力。
结果显示,智能体在工程任务上表现得相当熟练,但在提出假设、决定合适证据以及识别失败路径等核心科研环节上表现不佳。最终,原作者对 AI 生成的论文进行了严格评审,并给出了明确的否定评价。
所属事件:实测AI做开放式科研:烧钱耗时遭原作者全盘否决(8 条相关)→
「编程与Agent」频道最新
- terminal-browser:让 AI 智能体直接在终端操作浏览器 — ycombinator · 2026-07-31
- Allie Miller分享AI智能体日常提示词,语音模式结合计算机使用体验惊艳 — alliekmiller · 2026-07-31
- 开源项目:tmux 会话管理器注册为 MCP 服务器,让 Agent 自主命名会话 — khalon23 · 2026-07-31
- AdaMAST:用失败分类法提升AI代理表现 — abeirami · 2026-07-31
- Circle 设 5 万美元 Agentic Economy 奖,攻坚 AI 智能体自主支付 — PeterDiamandis · 2026-07-31
- Gemini API 实用技巧:Managed Agents 自带 7 天代码沙箱 — tristanbob · 2026-07-31