小米 MiMo-V2.6 技术报告:开源 7k 条 RL 训练数据,登顶 alphaXiv 热榜

rbhar90 · x · 2026-09-23

小米发布 MiMo-V2.6 全模态系列技术报告,核心是用大规模强化学习把模型推向自我改进:异步训练每步消耗 1,568 个样本、2737 亿 token,上下文最长 1M;RL 环境覆盖代码、通用、视觉与网络安全域;引入分组式 agentic 评分以获得更准的奖励信号,并冻结 MoE router、设多层防御对抗 reward hacking。

据 Elie Bakouch 引述,团队将开源约 7000 条 RL 训练数据和整套框架,且从启动最终 RL run 到发布模型加技术报告不到一周,在智能与开放程度上同时推进。训练动态、RL 环境与框架均已开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →