深度解析GRPO与策略蒸馏在大模型中的应用

近期发布的技术视频深度解析了同策略蒸馏(OPD)与GRPO等强化学习算法的数学原理和代码实现。视频指出,Kimi、DeepSeek、Qwen和GLM等国产前沿大模型的技术报告均表明,策略蒸馏和GRPO算法已成为驱动这些大模型提升性能的核心训练技术。

2026-08-03 ~ 2026-08-03 · 2 条相关