Hugging Face 直播讲解 GRPO:用强化学习训练智能体

Hugging Face 举办了主题为“Training Agents 3”的直播,重点探讨如何使用 GRPO 算法进行强化学习训练。课程标志着智能体训练从早期的模仿学习转向“按结果训练”,内容深入解析了验证器的构建、奖励黑客现象的防范,以及从 SFT 微调基线过渡到强化学习的完整实操流程。

2026-07-22 ~ 2026-07-22 · 2 条相关