AIRA₂ 研究智能体登顶 MLE-bench,81.5% 胜人类基线 72.7%

mariofilhoml · x · 2026-09-25

Martin Josifoski 团队发布下一代 AI 研究智能体 AIRA₂,针对规模化关键瓶颈做了系统改进:

转发者 mariofilhoml 特别推荐细读论文的 "Closing the Generalization Gap" 章节,并指出消融实验说明「验证集过拟合」在实践中通常不是大问题——他澄清指的是用验证集做超参优化后的模型选择,而非直接在验证集上训练。

所属事件:AIRA₂ 研究智能体登顶 MLE-bench,胜率 81.5% 超人类(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →