大模型强化学习训练遇高熵崩溃

开发者在端侧大模型强化学习训练中遇到挑战,模型在第 8 步频繁出现高熵低奖励的崩溃现象。为缓解大权重和 KV cache 占满显存以及 NCCL 权重同步带来的压力,开发者实测引入 LoRA 技术进行优化,以改善显存同步问题并推进稠密模型的 RL 训练实践。

2026-08-07 ~ 2026-08-07 · 2 条相关