智谱开源 RL 框架 Slime,实现训练与推理零误差对齐

teortaxesTex · x · 2026-08-12

智谱 GLM 系列训练背后的 RL 框架 Slime 正式开源了其确定性的「训练-推演对齐路径」(train–rollout alignment path)。

该方案解决了大模型强化学习训练中常见的训练端与推理端不匹配问题。目前,其 Megatron 训练与 SGLang 推演已实现极高精度的对齐:在 4096-token 的 logprob 平均绝对误差(MAE)低至 1.9e-7,且解码器 0-5 层的隐藏状态差异(hidden-state diff)完全为零。开发者建议,若在 RL 运行中遇到训练与推理不一致的棘手问题,可优先参考该框架的实现。

所属事件:智谱开源强化学习框架Slime(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →