大模型强化学习训练遇高熵崩溃
开发者在端侧大模型强化学习训练中遇到挑战,模型在第 8 步频繁出现高熵低奖励的崩溃现象。为缓解大权重和 KV cache 占满显存以及 NCCL 权重同步带来的压力,开发者实测引入 LoRA 技术进行优化,以改善显存同步问题并推进稠密模型的 RL 训练实践。
2026-08-07 ~ 2026-08-07 · 2 条相关
- 大模型训练遇高熵崩溃,开发者实搭 LoRA 优化显存同步 — mervenoyann · 2026-08-07
- 开发者实测端侧模型强化学习:引入 LoRA 大幅优化权重同步 — mervenoyann · 2026-08-07