LMSYS 推出 Miles 训练栈:原生支持 Blackwell 8-bit 与 4-bit RL
BanghuaZ · x · 2026-07-30
LMSYS 发布博客介绍了 Miles 训练框架中两项针对英伟达 Blackwell 架构优化的低精度强化学习(RL)方案,并与 @humansand 及 @nvidia 合作开源。
主要技术亮点包括:
- 在 rollout、前向和反向 GEMM 中实现端到端 MXFP8。
- 针对 MoE 模型实现硬件原生的 NVFP4 W4A4 RL。
- 训练与 rollout 间采用位精确量化器,减少不匹配。
- 提供细粒度的跨栈逐层精度控制。
在 Qwen3-30B-A3B 模型上,5 种低精度配置均能紧密追踪 BF16 的奖励曲线,同时显著减少 rollout 时间。
「Infra」频道最新
- AI 算力投资远超现金流:谷歌资本支出暴增 107% — Beth_Kindig · 2026-07-30
- Kimi K3 量化版发布:1-bit 压缩至 594GB 保留近 80% 精度 — BankApprehensive7612 · 2026-07-30
- Cerebras 谈 Agent 时代:新工作流将催生非 GPU 芯片架构 — sarahookr · 2026-07-30
- Cognition 实验室访谈:强化学习与推理优化正走向融合 — AAAzzam · 2026-07-30
- Vector Institute 拆解 MoE:4-bit 量化与 Flash Attention 2 部署实践 — VectorInst · 2026-07-30
- 云GPU部署LTX视频模型踩坑记:附自动化安装方案 — Humble_Cut6799 · 2026-07-30