MiMo-V2.6 疑为开源界最大单次 RL 训练,罗福莉称难度超 DeepSeek R1

teortaxesTex · x · 2026-09-22

小米 MiMo 团队负责人罗福莉发文介绍 MiMo-V2.6:按算力计,很可能是开源模型团队迄今最大规模的单次 RL 训练。她表示在算力极度稀缺的当下,仍投入数十人团队长期专注一件事——scaling up RL。

技术路线为 mid-training 打潜力、大规模 RL 释放潜力,称结果是当前开源第一模型,并力荐技术报告,认为会成为 Agent RL 方向的代表作。

她进一步评价:「其研究创新与工程挑战超过我曾部分参与的 DeepSeek R1。」

所属事件:小米开源 MiMo-V2.6 系列,登顶开源模型智能指数(19 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →