小米 MiMo 开源 RL 环境 verl 分支,附完整训练代码

eliebakouch · x · 2026-09-26

小米 MiMo 团队开源了其 OSS RL 训练环境与训练代码,仓库为 XiaomiMiMo/verl,fork 自 ByteDance Seed 团队发起、社区维护的 RL 后训练框架 verl(Volcano Engine Reinforcement Learning,即 HybridFlow 论文的开源实现)。

该框架定位为面向大模型的灵活、高效、可生产级使用的 RL 训练库,仓库包含 recipes、examples、docker 配置、agent 相关 skills 与配置等完整工程资产,可直接用于 RL 后训练实验。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →