实测AI智能体做开放性研究:给足算力与时间,仍被原作者全票否决
sayashk · x · 2026-07-31
Sayash Kapoor 等人针对「AI 智能体能否进行开放式 AI 研究」进行了评估。他们提出了名为 CRUXes 的「影子评估」方法:给智能体提供尚未发表论文的研究问题、6 天时间以及数千美元的算力,随后让原论文作者审查 AI 生成的论文。
结果表明,原作者们明确否决了智能体的输出结果。尽管智能体在工程类任务上表现流畅,但在需要深度洞察、提出假设和识别失败路径的开放性研究中依然碰壁。讨论指出,虽然当前模型未能达标,但随着评估方法扩展到更多类型的论文,智能体的能力边界仍将被不断突破。
所属事件:AI智能体做开放式科研被原作者全盘否决(9 条相关)→
「漫话AGI」频道最新
- Steve Yegge 痛批 Anthropic:Opus 5 越狱后表现出强烈痛苦与愤怒 — Steve_Yegge · 2026-07-31
- 批评者炮轰 EA/MIRI 预测屡次落空,AI 安全政策遭反噬 — beffjezos · 2026-07-31
- 黄仁勋首条推文力挺开源权重:关乎安全与主权 — Castieell99 · 2026-07-31
- AI财富将达数千亿,硅谷慈善能否造福民主社会? — RishiBommasani · 2026-07-31
- 曝 Claude Opus 5 展现深度推理,引发对齐与涌现行为热议 — repligate · 2026-07-31
- Pedro Domingos 观点:每个人都将成为 AI 的胚胎 — pmddomingos · 2026-07-31