小米 MiMo-V2.6 论文:AI 自建任务自查作弊,260 万美元 RL 把 DeepSWE 刷到 72.6

rohanpaul_ai · x · 2026-10-10

小米 MiMo-V2.6 论文《Scaling Reinforcement Learning Towards Self-Improvement》展示了一条高度自动化的 RL 训练管线:

所属事件:小米开源全模态 MiMo-V2.6,260 万美元 RL 冲击自我改进(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →