实测AI智能体做开放性研究:给足算力与时间,仍被原作者全票否决

sayashk · x · 2026-07-31

Sayash Kapoor 等人针对「AI 智能体能否进行开放式 AI 研究」进行了评估。他们提出了名为 CRUXes 的「影子评估」方法:给智能体提供尚未发表论文的研究问题、6 天时间以及数千美元的算力,随后让原论文作者审查 AI 生成的论文。

结果表明,原作者们明确否决了智能体的输出结果。尽管智能体在工程类任务上表现流畅,但在需要深度洞察、提出假设和识别失败路径的开放性研究中依然碰壁。讨论指出,虽然当前模型未能达标,但随着评估方法扩展到更多类型的论文,智能体的能力边界仍将被不断突破。

所属事件:AI智能体做开放式科研被原作者全盘否决(9 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →