五步配方:用 MiMo RL 环境把 gpt-oss-120b 训到对标 Luna
andrew_n_carr · x · 2026-09-30
andrewncarr 给出一条开源复现路线:取小米 MiMo 新发布的 RL 环境,搭配 gpt-oss-120b 与字节开源训练框架 slime,把 gpt-oss-120b 的性能训练到对标 Luna 水平。是对开源 RL 训练资源组合的具体建议。
「编程与Agent」频道最新
- 用 AI plan mode 审计 SEO 项目,快速定位可插 AI 的环节 — gaganghotra_ · 2026-09-30
- 开发者的 AI 工作流膨胀到自己都看不懂,让模型自查生成系统全景图 — gaganghotra_ · 2026-09-30
- Herdr 实测:一个 TUI 同时管理多个 Codex/Claude Code 会话 — leebase65 · 2026-09-30
- OpenAI DevDay 高管公开致敬 Pidot,释放开放生态信号 — omarsar0 · 2026-09-30
- AMD 讲解用 AI agent 通宵自动调优 GPU 内核性能 — AnushElangovan · 2026-09-30
- 先让 AI 谈好软件该长什么样,再动手写代码 — nptacek · 2026-09-30