小米开源全模态 MiMo-V2.6,260 万美元 RL 冲击自我改进
小米 MiMo 团队发布并开源全模态模型系列 MiMo-V2.6 及论文《Scaling Reinforcement Learning Towards Self-Improvement》,将 RL 算力视为通向模型自我改进的核心训练范式,并公开训练动态、RL 环境与框架。训练管线高度自动化,AI 可自建任务并自查作弊;投入约 260 万美元 RL 算力,单步使用 1568 个样本,将 DeepSWE 刷至 72.6 分。
2026-10-09 ~ 2026-10-10 · 2 条相关
- 小米开源 MiMo-V2.6:单步 1568 样本Scaling RL 冲击自我改进 — XiaomiMiMo · 2026-10-09
- 小米 MiMo-V2.6 论文:AI 自建任务自查作弊,260 万美元 RL 把 DeepSWE 刷到 72.6 — rohanpaul_ai · 2026-10-10