五步配方:用 MiMo RL 环境把 gpt-oss-120b 训到对标 Luna

andrew_n_carr · x · 2026-09-30

andrewncarr 给出一条开源复现路线:取小米 MiMo 新发布的 RL 环境,搭配 gpt-oss-120b 与字节开源训练框架 slime,把 gpt-oss-120b 的性能训练到对标 Luna 水平。是对开源 RL 训练资源组合的具体建议。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →