小米开源全模态 MiMo-V2.6,260 万美元 RL 冲击自我改进

小米 MiMo 团队发布并开源全模态模型系列 MiMo-V2.6 及论文《Scaling Reinforcement Learning Towards Self-Improvement》,将 RL 算力视为通向模型自我改进的核心训练范式,并公开训练动态、RL 环境与框架。训练管线高度自动化,AI 可自建任务并自查作弊;投入约 260 万美元 RL 算力,单步使用 1568 个样本,将 DeepSWE 刷至 72.6 分。

2026-10-09 ~ 2026-10-10 · 2 条相关