实测AI做科研:烧钱跑数百实验,结果被原作者全盘否决
sayashk · x · 2026-07-31
研究团队探索了 AI agent 能否胜任开放式的 AI 研究。他们让 agent 针对两篇未发表论文的研究问题进行探索,提供了 6 天时间以及数千美元的 API 和算力额度,并由原论文作者对 AI 生成的论文进行评审。
结果,原作者们明确拒绝了 agent 的产出。这种测试被称为“影子评估”。
尽管 agent 在工程任务上表现出色(如文献综述、调试 GPU 环境、运行数百次实验和排版 LaTeX),但在提出假设、判断证据有效性和识别失败方向等开放式科研核心能力上,依然远不及人类研究员。
所属事件:AI智能体实测做科研被原作者全盘否决(6 条相关)→
「编程与Agent」频道最新
- 巧用代码审查:将LLM负面指令转化为正面任务 — mattpocockuk · 2026-07-31
- 仅 126 字节代码片段致五大 Python 类型检查器连环崩溃 — charliermarsh · 2026-07-31
- HeyGen 获开源榜季度新锐奖,开源项目暴涨 300 倍 — toolstelegraph · 2026-07-31
- 微软推 Echoverse:用真实环境训练计算机控制智能体 — dejavucoder · 2026-07-31
- Prompt工程新风向:One-shot正逐渐取代Zero-shot — abacaj · 2026-07-31
- 重度开发者单月狂烧22亿Token,AI编程工具消耗惊人 — ShanRizvi · 2026-07-31