开源全栈系统 OpenMLE:为递归自我改进打造 executable 测试床
dair_ai · x · 2026-08-01
这是一篇关于递归自我改进的有趣论文,研究团队发布了完整的开源技术栈。
- 核心系统:机器学习工程为递归自我改进提供了具体的可执行测试床。OpenMLE 是一个全栈开源系统,涵盖带执行反馈的可验证任务环境、算子学习和长程搜索。
- 模型训练:团队后训练了 35B 参数的元进化智能体 Frontis-MA1,围绕草稿、改进、调试和交叉四个原子程序进化算子进行对齐。这些算子通过执行接地的 SFT 和 RL 训练,并组合成长程搜索。
- 评测表现:在 MLE-Bench Lite 上,单任务 12 小时预算(单卡 RTX 4090,限制 12GB 显存)下,模型的奖牌平均分从 39.39% 提升至 60.61%;结合异步搜索和基准独立经验,分数可达 71.21%。
「编程与Agent」频道最新
- 基于真实数据与 PR 记录,构建代码智能体专属评测基准 — Hacubu · 2026-08-01
- Y Combinator 开源内部多智能体框架 QM — ycombinator · 2026-08-01
- 开发者观点:只要需求清晰,AI 现在就能一键生成整套代码 — shauseth · 2026-08-01
- 开发者打造Aura本地Agent:将大模型降级为纯语音输出组件 — bryany97 · 2026-08-01
- Reddit热议:开发AI Agent时哪些坑是真正跑起来才遇到的? — Meher_Nolan · 2026-08-01
- 用 Obsidian 打造 AI 素材库:提升提示词效果与工作流 — EXM7777 · 2026-08-01