AIRA₂ 研究智能体登顶 MLE-bench,胜率 81.5% 超人类

Martin Josifoski 团队发布下一代 AI 研究智能体 AIRA₂,针对规模化关键瓶颈进行系统改进,在真实 ML 任务基准 MLE-bench-30 上取得 81.5% 的胜率,刷新 SoTA 并超过 72.7% 的人类基线。围绕论文的讨论中,作者澄清「验证集过拟合」指超参优化后用验证集做模型选择而非直接训练,并引用消融实验说明这种做法影响有限。

2026-09-25 ~ 2026-09-25 · 2 条相关