智谱开源强化学习框架Slime
智谱开源了用于GLM系列大规模训练的强化学习框架Slime。该框架提供了一条确定性的“训练-推演对齐路径”,成功解决了大模型强化学习基础设施中长期存在的训练与推理解码数值不匹配问题,实现了零误差对齐,为相关研发提供了可靠的底层技术支持。
2026-08-11 ~ 2026-08-12 · 2 条相关
- 开源GLM训练栈:解决RL训练与推理解码数值不匹配 — hsu_byron · 2026-08-11
- 智谱开源 RL 框架 Slime,实现训练与推理零误差对齐 — teortaxesTex · 2026-08-12