AI智能体独立撰写学术论文?CRUX基准测试揭示现状与争议

sethlazar · x · 2026-07-31

围绕 CRUX 基准测试,学术界对 AI 智能体独立完成 NeurIPS 级别学术论文的能力展开讨论。研究者 Sayashk 表示,该论文多元化的作者团队带来了丰富的视角碰撞,并欢迎外界通过“对抗性合作”来测试和优化新的智能体架构。

学者 Seth Lazar 指出,尽管目前模型撰写顶尖论文仍面临挑战,但他预计这一基准很快会被突破。他建议未来的评估不应局限于极具创新性的论文,还应测试模型在完成“渐进式、微小推进”的常规学术工作上的表现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →