开源GLM训练栈:解决RL训练与推理解码数值不匹配

hsu_byron · x · 2026-08-11

Slime Framework 开源了其用于 GLM-5.2 规模训练的确定性训练-推演对齐技术栈。

该方案主要解决了大模型强化学习(RL)基础设施中长期存在的训练与推演数值不匹配问题。技术栈全面覆盖了 FP8 权重与 FP8 KV 推演、DeepEP、DeepGEMM 以及稀疏注意力机制,为生产级规模的支持提供了无折衷的开源方案。

所属事件:智谱开源强化学习框架Slime(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →