35B模型结合进化算法超越GPT-5.5,实现递归自我改进

cwolferesearch · x · 2026-08-03

当前多数递归自我改进(RSI)研究依赖编码智能体进行简单的爬山算法。本文介绍的 Frontis-MA1(35B)尝试引入进化/遗传算法来释放更大潜力。

该模型被训练为一个面向机器学习工程(MLE)的元进化智能体,核心机制包含四个原子操作:草拟、改进、调试和交叉。它不再只生成单一方案,而是在沙盒中演化大量候选代码,通过执行真实任务得分来指导长周期搜索。

实验结果显示,在 MLE-Bench Lite 测试中(单卡 RTX 4090 限制下),该系统将基础模型的奖牌平均得分从 39.39% 提升至 60.61%,在使用经验先验和异步搜索的 Evo-Max 机制下更是达到 71.21%,超越了 GPT-5.5 + Codex,逼近 GPT-5.6 Sol 和 2.8T 参数的 Kimi K3。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →