MiMo-V2.6 被称最大开源 RL 单次训练,登顶开源模型

andrew_n_carr · x · 2026-09-22

被引用的原帖来自 @LuoFuli,介绍 MiMo-V2.6 的 RL 扩展之路:在算力极度稀缺的环境下,团队投入数十人长期专注于单目标——把 RL 规模化,据称是开源模型团队迄今算力规模最大的单次 RL 训练之一。模型潜力通过 mid-training 建立、再通过高强度 RL 释放,目前位居开源模型第一,作者强烈推荐阅读其技术报告。

主帖作者 andrewncarr 表示 mixRL flex 表现不错,正在内部 3D 评测上对这些模型做基准测试。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →