小米 MiMo-V2.6 公开 RL 训练:DeepSWE 从 58.4 冲至 72.57
teortaxesTex · x · 2026-09-23
nrehiew 发布了关于 MiMo-V2.6(最新开源模型)的论文解读,该模型是最新一个公开直播 RL 训练过程的项目。论文与 DeepSeek v4.1 Flash 的侧重不同,主要聚焦数据构造和 RL 实验结果。
关键结果:MiMo RL 训练已完成,pro 模型在 DeepSWE 上从 58.41 提升到 72.57。作为对比,DeepSWE 当前最高分为 74,由 Astra、Gemini 3.8 Flash 和 Opus 5 保持——开源模型已逼近 SOTA 水平。
所属事件:小米 MiMo 完成 RL 训练,DeepSWE 跃升至 72.57(2 条相关)→
「模型」频道最新
- Opus 5.5 与 GPT-6 Sol/Luna 一夜齐发,OpenAI 价格砍半抢市场 — AlchainHust · 2026-09-23
- 实测者称 Claude Opus 5.5 拥有迄今最好的视觉设计能力 — repligate · 2026-09-23
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23
- 研究者观察:爱晒AI吹捧自己的多是反社会行为者 — repligate · 2026-09-23
- 评Opus 5.5:语料满是摘要的摘要,一手经验最稀缺 — mimi10v3 · 2026-09-23
- Claude Opus 5.5 登 FrontierSWE 第二名,62.3% 仅次于 GPT-6 Astra — scaling01 · 2026-09-23