小米 MiMo 开源 RL 环境 verl 分支,附完整训练代码
eliebakouch · x · 2026-09-26
小米 MiMo 团队开源了其 OSS RL 训练环境与训练代码,仓库为 XiaomiMiMo/verl,fork 自 ByteDance Seed 团队发起、社区维护的 RL 后训练框架 verl(Volcano Engine Reinforcement Learning,即 HybridFlow 论文的开源实现)。
该框架定位为面向大模型的灵活、高效、可生产级使用的 RL 训练库,仓库包含 recipes、examples、docker 配置、agent 相关 skills 与配置等完整工程资产,可直接用于 RL 后训练实验。
「编程与Agent」频道最新
- ElevenLabs 实时识别电话诈骗,180ms 出结果成本不到半美分 — TheMoonMidas · 2026-09-26
- 实测案例:Opus 5.5 在架构级任务上明显胜过 GPT-6 Sol — DataLearnerAI · 2026-09-26
- Claude 常「杀掉」自己的 grep/shell 进程,prompt 规则也拦不住 — SebastianNehrd2 · 2026-09-26
- 网友用 Claude Opus 5.5 一小时做出 Blackwell GPU 3D 动画 — EricBuess · 2026-09-26
- 开发者大会总结:AI 编码正走向「智能体软件工厂」 — ahahabbak · 2026-09-26
- 研究者感叹:分析恶意 agent 行为已离不开 AI,人工审计跟不上规模 — JeffLadish · 2026-09-26