小米 MiMo-V2.6 技术报告:开源 7k 条 RL 训练数据,登顶 alphaXiv 热榜
rbhar90 · x · 2026-09-23
小米发布 MiMo-V2.6 全模态系列技术报告,核心是用大规模强化学习把模型推向自我改进:异步训练每步消耗 1,568 个样本、2737 亿 token,上下文最长 1M;RL 环境覆盖代码、通用、视觉与网络安全域;引入分组式 agentic 评分以获得更准的奖励信号,并冻结 MoE router、设多层防御对抗 reward hacking。
据 Elie Bakouch 引述,团队将开源约 7000 条 RL 训练数据和整套框架,且从启动最终 RL run 到发布模型加技术报告不到一周,在智能与开放程度上同时推进。训练动态、RL 环境与框架均已开源。
「模型」频道最新
- 用户抱怨 GPT-6 Sol 无视已配置技能,同配置 GPT-5.6 却正常 — Aber-so-richtig · 2026-09-23
- 4 个 agent 一个半小时,Opus 5.5 从零造出惊艳作品 — repligate · 2026-09-23
- 爆料人辟谣:本周不会有 Kimi 新模型,团队周五开始放假 — ChrisGPT · 2026-09-23
- Reddit 用户截图:GPT-5.6 Sol 对 Go 订阅用户免费开放 — sam619007 · 2026-09-23
- 风向又变:Opus 5.5 获好评,GPT-6 Sol 未登陆 ChatGPT 引争议 — koltregaskes · 2026-09-23
- Opus 5.5 成日常主力:更快更便宜,Pro/Max 用户获重置额度 — addyosmani · 2026-09-23