Miles v0.1论文公开:全栈生产级后训练系统,支持LoRA与扩散模型
aigclink · x · 2026-09-13
Miles v0.1 的论文(arXiv:2609.08368)与 GitHub 仓库公开。这是一套面向前沿后训练的全栈、生产级系统,基于 slime 的简洁设计,围绕「组件可验证、干净、可定制」原则构建 RL 训练循环的每个阶段,把准确性、效率、可靠性与可扩展性作为一等目标。
架构要点
- rollout 引擎基于 SGLang;训练器可选两种后端:NVIDIA Megatron-LM 与 PyTorch FSDP。
- 三种权重同步传输方式,适配不同部署拓扑。
- 除全参数 RL 外,还支持 LoRA RL、on-policy 蒸馏、监督微调,以及 true-on-policy 的 rollout-training 对齐,并将同一架构扩展到 diffusion 模型。
- 端到端案例:在 GLM-5.2 744B-A40B 上做全异步 agentic RL,任务为终端使用与编程,跑在 64 张 NVIDIA GB300 上,前 30 步中位步时 263 秒。
代码开源在 github.com/radixark/miles,项目主页 miles.radixark.com。
所属事件:SGLang团队开源生产级后训练框架Miles v0.1(2 条相关)→
「Infra」频道最新
- 云 agent 并行 vs 本地 Mac:altryne 称云端跑 agent 才是正解 — altryne · 2026-09-13
- $5000 出 5090 换 M5 Ultra 96GB?带宽 1.8 vs 1.2 TB/s 的纠结 — unchikuso · 2026-09-13
- 专用栈逆袭通用框架:原生 MTP 推测解码提速 154% — AccBalanced · 2026-09-13
- 开发者用 CUDA 加速 Minecraft 世界生成,并与 Java 版逐位一致验证 — gandamu_ml · 2026-09-13
- 网友喊话华为:做台 1TB 显存的桌面推理盒,摆脱 Nvidia 依赖 — AIFlow_ML · 2026-09-13
- 一个月冒出 5 个专用推理引擎,生态碎片化引争议 — JustinLin610 · 2026-09-13