Hugging Face 直播讲解 GRPO:用强化学习训练智能体
Hugging Face 举办了主题为“Training Agents 3”的直播,重点探讨如何使用 GRPO 算法进行强化学习训练。课程标志着智能体训练从早期的模仿学习转向“按结果训练”,内容深入解析了验证器的构建、奖励黑客现象的防范,以及从 SFT 微调基线过渡到强化学习的完整实操流程。
2026-07-22 ~ 2026-07-22 · 2 条相关
- Hugging Face 讲解 GRPO:把 agent 训练从模仿带到强化学习 — Hugging Face · 2026-07-22
- 新一期 agent 训练直播讲 GRPO:验证器、奖励黑客与实操 — ben_burtenshaw · 2026-07-22