小米 MiMo 开源 MiMo-V2.6 RL 训练数据集,含代码与多模态样本
iScienceLuvr · x · 2026-09-26
小米 MiMo 团队将强化学习数据集 MiMo-V2.6-RL-oss 上传至 Hugging Face 并以 Apache-2.0 许可开源,被社区评价为"非常难得"。数据集规模在数千样本级别,模态覆盖文本、图像与文档,格式为 parquet,内容包含真实代码测试用例等 RL 训练样本。对想做模型 RL 后训练复现或研究的人来说是一份可直接下载使用的开源资源。
所属事件:小米开源 MiMo-V2.6 强化学习数据集登 HF 热榜(5 条相关)→
「研究」频道最新
- 斯坦福用哲学概念做预训练:自生成普适事实,Noah Goodman 戏称实现 ASI — xuanalogue · 2026-09-26
- 新方法可在多款模型上找出「伪探针」:评测时推荐绿茶,生产中却推乌龙 — jankulveit · 2026-09-26
- 三篇论文一个信号:1% 合成数据即可引发强模型坍塌,大模型反而放大 — suchenzang · 2026-09-26
- 合成数据的重点正在转移:后训练里模拟将比蒸馏更重要 — realsohamparekh · 2026-09-26
- 新研究:利用多模型分歧定位专家标注,数月码本修订缩至数天 — windx0303 · 2026-09-26
- 开发者盛赞持续学习论文:AGI 定义早在 2000 年就有,却无人照此训练 — willcb · 2026-09-26