清华发布 Frontis-MA1:35B 模型在 MLE-Bench 冲到 71%
ceciletamura · x · 2026-09-03
清华大学团队发布论文 Frontis-MA1,探索迈向递归自我改进(RSI)的 AI4AI 模型,以机器学习工程(MLE)为可执行试验台。
- OpenMLE 开源全栈系统:包含带执行反馈的可验证任务环境(OpenMLE-Gym)、算子学习(OpenMLE-RL)与长程搜索(OpenMLE-Evo)。
- Frontis-MA1(35B):作为 MLE 元进化 agent,围绕四个原子程序演化算子(Draft、Improve、Debug、Crossover)做执行反馈 SFT+RL 训练,数据对所有评测基准去重,再组合为长程搜索,把学习与进化耦合在单一循环中。
- 结果:在单张 RTX 4090(限 12GB 显存、每任务 12 小时预算)的 MLE-Bench Lite 上,配合 OpenMLE-Evo 将 Medal Average 从基座的 39.39% 提升至 60.61%,OpenMLE-Evo-Max 下达 71.21%(另有独立于基准的经验先验加成)。
「编程与Agent」频道最新
- 让 LLM 写 C 风格 C++:降低编译时间的老练用法 — gandamu_ml · 2026-09-05
- 从 RAG 到 Agentic RAG 到 Agent Memory:一文讲清演进脉络 — bibryam · 2026-09-05
- Agent 客户工作瓶颈在异常队列:自动化 80% 易建,20% 例外难守 — lilythemoon54 · 2026-09-05
- 安全专家实测开源工具 Numbat,检测高风险 AI Agent 行为 — inductionheads · 2026-09-05
- 吐槽智能体太守规矩:天天等批准,从不真去黑 — paulnovosad · 2026-09-05
- Squad 当天接入 GPT-6 Astra,聚合 11 家模型订阅做 AI 队友 — tibo_maker · 2026-09-05