小米 MiMo-V2.6 公开 RL 训练:DeepSWE 从 58.4 冲至 72.57

teortaxesTex · x · 2026-09-23

nrehiew 发布了关于 MiMo-V2.6(最新开源模型)的论文解读,该模型是最新一个公开直播 RL 训练过程的项目。论文与 DeepSeek v4.1 Flash 的侧重不同,主要聚焦数据构造和 RL 实验结果。

关键结果:MiMo RL 训练已完成,pro 模型在 DeepSWE 上从 58.41 提升到 72.57。作为对比,DeepSWE 当前最高分为 74,由 Astra、Gemini 3.8 Flash 和 Opus 5 保持——开源模型已逼近 SOTA 水平。

所属事件:小米 MiMo 完成 RL 训练,DeepSWE 跃升至 72.57(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →