MiMo-V2.6 疑为开源界最大单次 RL 训练,罗福莉称难度超 DeepSeek R1
teortaxesTex · x · 2026-09-22
小米 MiMo 团队负责人罗福莉发文介绍 MiMo-V2.6:按算力计,很可能是开源模型团队迄今最大规模的单次 RL 训练。她表示在算力极度稀缺的当下,仍投入数十人团队长期专注一件事——scaling up RL。
技术路线为 mid-training 打潜力、大规模 RL 释放潜力,称结果是当前开源第一模型,并力荐技术报告,认为会成为 Agent RL 方向的代表作。
她进一步评价:「其研究创新与工程挑战超过我曾部分参与的 DeepSeek R1。」
所属事件:小米开源 MiMo-V2.6 系列,登顶开源模型智能指数(19 条相关)→
「模型」频道最新
- Vals AI 评测:Grok 4.7 综合分不升反降,跌至第 24 名 — zacharynado · 2026-09-22
- Grok 4.7 第二例:分析三年财报,识破汇率掩盖的增长真相 — ArtificialAnlys · 2026-09-22
- Grok 4.7 实测案例:能独立跑估值链并质疑交易伙伴的估算 — ArtificialAnlys · 2026-09-22
- Artificial Analysis 实测 Grok 4.7:仅次于 Anthropic,成本约 Opus 5 一半 — ArtificialAnlys · 2026-09-22
- 安全研究者算账:像前沿实验室那样测 ExploitBench 要烧 5930 万美元 API 费 — OwariDa · 2026-09-22
- 小米发布 Qwen 3.5 9B 蒸馏模型,用 MiMo 数据 SFT 并开源 RL 环境 — teortaxesTex · 2026-09-22