AIRA₂ 研究智能体登顶 MLE-bench,81.5% 胜人类基线 72.7%
mariofilhoml · x · 2026-09-25
Martin Josifoski 团队发布下一代 AI 研究智能体 AIRA₂,针对规模化关键瓶颈做了系统改进:
- 在真实 ML 任务 MLE-bench-30 上取得 SoTA 81.5%,超过此前 72.7%;
- 在 AIRS-Bench 的 20 个多样化 AI 研究任务中有 6 个超越人类 SoTA,另「攻破」了 5 个;
- 展现出强且可预测的 scaling 特性,团队强调推动 AI 研究前沿需要可扩展的系统,并把瓶颈与解决经验用于下一版迭代。
转发者 mariofilhoml 特别推荐细读论文的 "Closing the Generalization Gap" 章节,并指出消融实验说明「验证集过拟合」在实践中通常不是大问题——他澄清指的是用验证集做超参优化后的模型选择,而非直接在验证集上训练。
所属事件:AIRA₂ 研究智能体登顶 MLE-bench,胜率 81.5% 超人类(2 条相关)→
「模型」频道最新
- 大学生吐槽:$30/月的 Gemini Pro 幻觉频发令人失望 — makeitbumthem · 2026-09-25
- Meta AI 应用前 12 天北美下载 180 万,超同期 ChatGPT — Beth_Kindig · 2026-09-25
- Opus 5.5 用量更合理:20x 套餐最长会话跑满 13 小时 — majidmanzarpour · 2026-09-25
- 分类模型 Jev 号称快 200 倍便宜 400 倍,或重塑 AI 应用架构 — rseroter · 2026-09-25
- Prime Intellect 推理服务上线,号称 GLM 5.3 最高吞吐 — willcb · 2026-09-25
- 开发者拆解 Claude Code:思考提示语只是按 15 秒定时器轮换 — ryunuck · 2026-09-25