小米开源 MiMo v2.6 pro/flash 的 RL 训练环境与代码
zainhas · x · 2026-09-26
- 小米在 Hugging Face 上开源了用于 RL 训练 MiMo v2.6 pro/flash 的环境与代码,数据集为 XiaomiMiMo/MiMo-V2.6-RL-oss,采用 Apache-2.0 许可证。
- 开源内容包括文档、图像、文本模态的 RL 训练数据,可供社区复现或借鉴其强化学习训练流程。
所属事件:小米开源 7000+ 强化学习任务环境助训 MiMo(3 条相关)→
「研究」频道最新
- 阿里开源 Ovis-Embedding:文图音视统一嵌入,MMEB-v3 达 SOTA — solyarisoftware · 2026-09-27
- 观点:预训练本质上是全信息反馈的单 token rollout RL — burny_tech · 2026-09-27
- 语言带宽仅约 56k 调制解调器,模型训练的只是世界的有损残影 — yunta_tsai · 2026-09-27
- 先天—经验之争或源于「学习」一词的多义性 — abenitezburraco · 2026-09-27
- 实验:LLM 的 JSON 合法≠决策一致,一致性最低仅 14.4% — tenkei_01 · 2026-09-27
- 一文梳理强化学习自博弈的演化史:从 TD-Gammon 到 AlphaGo — cephaloform · 2026-09-27