SGLang团队开源Miles v0.1:64卡训744B模型,每步263秒
aigclink · x · 2026-09-13
SGLang 系团队开源了生产级后训练框架 Miles v0.1,把企业自训专属模型从「烧钱赌博」变成工程问题,Docker 一键起,换上自有数据和任务即可训练。
核心能力
- 主打 agentic RL:让模型在真实环境反复试错,学会用工具、操作终端、完成多步任务,目标是「能干活」而非「会聊天」。
- 支持千亿级模型:论文案例中 GLM-5.2(744B-A40B) 跑终端编程任务,64 张 NVIDIA GB300,前 30 步中位步时 263 秒。
- 稳定性:针对大规模 RL 跑到一半崩溃的痛点做了优化,Modal 评价「长时间运行一直很稳」。
- 一套框架覆盖 SFT、RL、蒸馏、LoRA,并扩展到 diffusion 模型。
- 数据本地化:权重与训练记录全在自己手里,适配金融、医疗、政府等客户。
- 支持 DeepSeek、Qwen、GLM、Kimi、Gemma、Nemotron 等主流模型,N 卡与 AMD 卡均可跑。
- 已被 Periodic Labs(几千卡训万亿参数)、Modal、IBM、Decagon、Nebius 在生产环境使用。
作者认为创业公司可认真考虑做垂直模型,大企业私有化训练成本风险可控,AI 服务商/FDE 或迎来新市场。
所属事件:SGLang团队开源生产级后训练框架Miles v0.1(2 条相关)→
「Infra」频道最新
- 网友喊话华为:做台 1TB 显存的桌面推理盒,摆脱 Nvidia 依赖 — AIFlow_ML · 2026-09-13
- 一个月冒出 5 个专用推理引擎,生态碎片化引争议 — JustinLin610 · 2026-09-13
- Cloudflare CEO:全球知识工作者各跑一个 Agent 需 40 倍 CPU — BenBajarin · 2026-09-13
- 2026全球AI芯片峰会上海启幕,三大高峰论坛与五场研讨会齐发 — 智东西 · 2026-09-13
- 本地 LLM 押注一年后:早买 GPU 的用户庆幸买晚了 — nptacek · 2026-09-13
- evenings 读 terahertz 脉冲反射法,逐层看 CoWoS 封装 — jwt0625 · 2026-09-13